思科 2026 报告:AI 正在重塑广域网
AI 带来的变化已经不只是对算力的需求增长。随着 AI 推理,尤其是 Agentic AI 的快速普及,网络流量本身的行为模式也正在发生根本变化。
思科在 2026 年发布的《AI Impact on Wide Area Networks》(AI 对广域网的影响)特别研究报告,结合电信运营商真实网络流量数据、AI Agent 实验室测试,以及 Gartner、IBM、Morgan Stanley 等机构的行业预测,对 AI 正在如何改变广域网进行了系统分析。
报告最值得关注的结论是:AI 流量并不只是让网络中的数据变多,它还改变了流量持续时间、上下行比例、吞吐率以及端到端延迟构成。
随着 AI Agent 能够自主调用工具、访问外部数据并循环执行复杂任务,软件生成网络请求的速度也将远远超过人类操作。
思科预测,到 2035 年,AI 推理流量可能占全球互联网总流量的约 25%。
这意味着未来网络运营商和企业不仅需要扩充带宽,还必须重新思考容量规划、安全策略、QoS、流量识别以及可观测性体系。
📈 AI 推理流量当前占比不高,但增长极其迅猛 #
目前,AI 推理流量的绝对规模仍然远小于视频流媒体等传统互联网业务,因此还没有成为网络流量的主体。
但它的增长速度已经非常惊人。
根据思科报告引用的数据:
- OpenRouter 的 AI Token 消耗量同比增长约 10 倍。
- 两家电信运营商的现场数据表明,仅在八个月内,AI 推理流量就增长了约 4 倍。
- 到 2035 年,AI 推理流量预计可能占全球网络流量的约 25%。
思科用了一个非常形象的比喻:AI 推理流量就像网络世界中的一种“新物种”,因为它并不遵循传统网络流量的规律。
TCP 与 QUIC #
从传输协议层来看,TCP 和 QUIC 在 AI 推理流中分别占据接近一半的流数量。
但如果按照数据量计算,QUIC 承载了约 57% 的 AI 推理流量。
这一点对网络安全尤其重要。
QUIC 本身具有加密特性,因此传统 Deep Packet Inspection(DPI,深度报文检测)系统很难像过去一样通过应用层信息准确识别 AI 服务。
可以将这种变化简单理解为:
传统流量识别
│
▼
加密传输层
│
▼
DPI / 应用层检测
│
▼
服务识别
AI 推理流量
│
▼
加密 QUIC
│
▼
应用层可见性降低
│
▼
需要新的识别策略
随着 AI 流量持续增长,安全设备不能再假设应用行为能够通过传统 DPI 方式轻易观察和分类。
🔄 AI 推理流量的四大核心特征 #
过去几十年的网络优化,主要围绕人类交互、突发式下载,以及以下行流量为主的 Web 和视频业务展开。
AI 推理则表现出完全不同的特征。
思科重点分析了四个维度:
- 流持续时间更长
- 吞吐率更低但更加平稳
- 上行流量占比提高
- 端到端延迟的主要瓶颈正在发生变化
这四个变化可能逐渐打破传统 WAN 和互联网基础设施长期形成的设计假设。
⏱️ AI 会让网络会话持续时间翻倍 #
传统 Web 流量通常具有明显的突发特征。
浏览器请求资源,服务器快速返回页面、图片或其他数据,然后连接很快结束。
LLM 推理则完全不同。
模型通常需要逐 Token 生成输出,因此一个推理请求可能会持续更长时间。
思科报告中的测量数据显示:
| 流量类型 | 中位流持续时间 |
|---|---|
| 标准非 LLM Web 流 | 643 ms |
| LLM 推理流 | 1,292 ms |
也就是说,在报告测试条件下,LLM 推理流的中位持续时间约为普通 Web 流的 2 倍。
“细水长流”式流量 #
这种差异可以简单表示为:
传统 Web 流量
带宽
│
│ ███████████
│ ███████████
│ ███████████
│______███████████____________ 时间
AI 推理流量
带宽
│
│ ▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂
│ ▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂
│_▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂▂_____ 时间
传统 Web 业务可能瞬间传输大量数据,然后恢复到低流量状态。
而 AI 推理更像是一条持续的小流量数据流。
这会给网络设备带来一个容易被忽视的问题。
防火墙、DPI、负载均衡器以及其他有状态网络设备,都需要更长时间维护连接状态。即使单个 AI 流的带宽消耗并不高,更长的连接生命周期也可能增加连接跟踪和状态表的压力。
思科因此认为,未来网络架构可能需要进一步向分布式方向发展,例如采用 Cisco Hypershield 所代表的架构,以降低状态表不断膨胀带来的风险。
📉 AI 流量峰值吞吐率明显更低 #
AI 推理流量的另一个重要特征是:它比传统 Web 流量更加平滑。
报告指出,标准 Web 流量的中位流速大约是 AI 推理流量的 10 倍。
原因很简单。
Web 应用可以一次性下载图片、静态资源甚至视频片段,从而形成明显的流量峰值。
而 LLM 通常逐 Token 生成结果,不会一次性把整个响应发送出去。
因此,AI 流量更接近:
传统 Web
高峰值
▲
│ ███
│ ███
│ ███
─────┴───────┴──────────► 时间
AI 推理
低速但持续
▲
│ ▂▂▂▂▂▂▂▂▂▂
│▂▂▂▂▂▂▂▂▂▂▂▂
─────┴──────────────────► 时间
传统 QoS 策略可能不再适用 #
传统 QoS 系统往往围绕峰值带宽、突发流量和队列管理进行优化。
AI 推理需要解决的问题有所不同。
它更需要的是稳定、可预测的低速连接质量。
因此,一个网络即使拥有充足的总带宽,如果调度、排队和拥塞控制策略与 AI 流量特征不匹配,也可能导致糟糕的 AI 服务体验。
未来网络的目标不再只是最大化峰值吞吐率。
对于 AI 服务而言,持续稳定的服务质量可能更加重要。
⬆️ AI 正在提高对上行带宽的需求 #
传统互联网长期以来具有明显的下行主导特征。
用户下载网页、视频、软件以及其他内容,因此下行流量通常远高于上行流量。
AI 推理正在改变这一模式。
思科数据显示,大约 9% 的 AI 推理流具有高于下行的上行流量,而传统 HTTP 事务中这一比例只有约 0.5%。
造成这一差异的重要原因,是 AI 请求携带的上下文越来越大。
简单的聊天 Prompt 可能只有几句话,但企业 AI Agent 可能需要发送:
- 长文档
- 历史对话
- 工具调用结果
- 代码仓库
- 数据库查询结果
- 图片及其他多模态输入
- 持久化任务上下文
随着 Agentic AI 普及,Agent 还可能在任务执行过程中持续上传上下文和中间状态。
重新思考网络容量规划 #
这一变化同时影响固定宽带和移动通信网络。
过去:
容量规划
│
├── 优先保障下行
│
└── 上行作为次要因素
AI 时代:
容量规划
│
├── 下行
├── 上行
├── 流量对称性
└── AI 应用行为
这一变化对无线接入网络(RAN)尤其重要,因为移动网络的上行能力往往比下行更加受限。
⏳ AI 服务的主要延迟瓶颈目前仍然不是网络 #
思科报告另一个值得关注的结论是:当前 AI 推理体验的主要瓶颈往往来自模型计算,而不是网络传输。
可以用一个简化公式表示:
总推理延迟 = TTFT +(TPOT × 输出 Token 数量)
其中:
- TTFT = Time to First Token,即首 Token 延迟
- TPOT = Time Per Output Token,即每个输出 Token 所需时间
一次完整 AI 推理通常需要数百毫秒到数秒,而在报告讨论的场景中,纯网络传输延迟大约只有 20–50 ms。
因此,在当前阶段,模型计算仍然是主要瓶颈。
随着 AI 硬件加速,瓶颈将发生转移 #
真正值得关注的问题是:如果未来 GPU、AI 加速器和模型优化不断缩短推理计算时间,会发生什么?
答案是,网络延迟在总延迟中的占比会越来越高。
当前
模型计算 ████████████████████
网络 ██
更快的 AI 硬件
模型计算 ████████
网络 ████
未来
模型计算 ████
网络 ████
这意味着网络运营商不能只关注传统的 Ping 延迟。
未来还需要监控:
- TTFT
- Token 生成延迟
- 完整推理延迟
- Agent 任务完成时间
- 推理服务可用性
Token 生成速度直接影响用户体验 #
以报告引用的一个例子为例,如果某模型的 Token 生成速度约为 9 ms/Token:
- 100 Tokens ≈ 1 秒
- 600 Tokens ≈ 5.4 秒
实际性能会因模型、服务商、推理配置和硬件不同而存在巨大差异。
但趋势非常明确:
当推理速度越来越快之后,网络延迟将从次要因素逐渐变成关键因素。
🤖 Agentic AI:网络世界的新“超级用户” #
传统 LLM 交互通常比较简单:
人类
│
▼
Prompt
│
▼
LLM
│
▼
响应
Agentic AI 则完全不同。
AI Agent 可以自主进行任务规划、调用工具、访问数据、调用外部 API,并不断循环执行,直到完成目标。
可以将其抽象为:
┌───────────────┐
│ AI Agent │
│ 逻辑 / 代码 │
└───────┬───────┘
│
Agent ↔ LLM
│
▼
┌───────────────┐
│ LLM 推理 │
└───────┬───────┘
│
┌──────────┼──────────┐
▼ ▼ ▼
搜索 API 数据库
│ │ │
└──────────┴──────────┘
│
▼
结果
这种架构会产生完全不同的网络负载。
🧪 思科的 AI Agent 实验 #
思科在实验室环境中使用 LangChain Open Deep Research Agent 进行了测试。
实验要求 AI Agent 收集与 Cisco 相关的信息,包括:
- 公开网站
- 社交媒体
- 新闻
- 合作伙伴信息
- 高管博客
- 社交平台内容
整个任务产生了约 26.8 MB 网络流量。
根据报告,这一流量相比人类执行同样任务增加了 450%,其中约 70% 的新增流量来自 AI 推理。
这个实验说明,AI Agent 不应该简单地被视为又一个普通应用。
它可能成为网络中极其活跃的流量生成者。
⚡ Agent 按照软件速度运行 #
人类可能需要几秒甚至几分钟才能完成一次点击、阅读和下一步操作。
Agent 则可以在几毫秒内发起大量请求。
这种速度差异会直接改变单个任务产生的网络流量规模。
人类工作流
点击 → 阅读 → 思考 → 点击
│ │ │ │
数秒 / 数分钟
Agent 工作流
请求 → 请求 → 请求 → 请求
→ 工具调用 → 推理 → 工具调用
→ API → 搜索 → 推理 → API
│
毫秒级
因此,Agentic AI 可以真正成为网络中的超级用户。
一个 AI Agent 在执行单个任务时产生的网络交互频率,可能远远超过人类操作。
🧠 Agent 与 LLM 的连接正在成为“脊髓” #
思科将 Agent 软件与 LLM 推理服务之间的通信路径视为整个 Agent 架构中的关键组成部分。
这个比喻非常准确:Agent 与模型之间的推理连接就像 Agent 的“脊髓”。
如果这条路径出现:
- 丢包
- 拥塞
- 延迟抖动
- 服务不可用
- 安全策略阻断
Agent 的任务执行能力就可能立即受到影响。
这意味着网络可靠性的重要性正在发生变化。
对于传统应用来说,少量延迟或丢包可能只产生有限影响。
但对于一个不断调用 LLM 的 Agent 而言,推理路径中的一次性能下降可能会影响整个任务循环。
🔁 Agent 流量会形成复杂通信循环 #
AI Agent 并不只与一个服务器通信。
它可能同时访问:
- 其他 Agent
- LLM 推理服务
- API
- 数据库
- 搜索系统
- 云服务
- 本地应用
- 私有数据中心
- 公有云
- 企业内部工具
因此,Agent 的通信关系更像一张高度分布式的网络图。
┌──────────┐
│ Agent A │
└────┬─────┘
│
┌──────────────┼──────────────┐
▼ ▼ ▼
LLM API Agent B 搜索服务
│ │ │
▼ ▼ ▼
AI 推理 工具 API Web 数据
│ │ │
└──────────────┼──────────────┘
▼
数据库
在这种模式下,网络已经不再只是底层传输设施,而逐渐成为 Agent 执行环境的一部分。
MCP 正在提供标准化接口 #
报告特别提到,**MCP(Model Context Protocol,模型上下文协议)**正在成为 Agent 与工具之间通信的重要标准。
标准化可以降低系统之间的集成复杂度,但并不意味着网络流量会变得简单。
随着越来越多的 Agent 通过标准化接口访问工具,网络中可能出现更多结构化、重复性以及机器生成的交互。
标准化协议 + 软件级执行速度,很可能成为 AI 原生网络的重要特征。
🏢 企业 Agentic AI 可能推动 9 倍流量增长 #
思科结合 Gartner、IBM、Morgan Stanley 等机构的数据和预测,对 2026–2035 年企业网络流量进行了长期建模。
报告引用的几个关键预测包括:
- 到 2026 年,40% 的企业应用将集成专用 AI Agent。
- 到 2027 年,80% 的高管预计会认为企业生存依赖 Agentic AI。
- 到 2035 年,Agentic AI 可能贡献企业软件收入的 30%。
- 相关全球市场规模可能超过 4,500 亿美元。
其中最值得关注的是 AI 对企业网络流量增长的影响。
如果没有大规模 Agentic AI:
企业网络流量 → 十年增长约 2.5 倍
如果 Agentic AI 广泛普及:
企业网络流量 → 十年增长约 9 倍
两种情景之间存在巨大差异。
AI 将深入企业核心业务系统 #
未来 Agent 可能深度集成到:
- CRM
- ERP
- IT 运维
- 风险管理
- 合规
- 客户支持
- 数据分析
- 企业自动化
过去由员工逐步执行的操作,现在可能由 Agent 连续执行推理、工具调用和系统交互。
因此,WAN 面临的压力不仅来自流量总量增加,还来自机器生成的高密度交互。
🌐 消费级 AI 可能额外推动 63% 的互联网流量增长 #
消费级 AI 同样正在成为网络流量增长的重要驱动力。
思科引用的数据显示,到 2025 年年中,美国成年人中约 61% 在过去六个月使用过 AI 工具,而全球与 AI 交互的人数已经达到约 17–18 亿。
未来 AI 的应用范围还会继续扩大,包括:
- AI 个人助手
- AI 购物 Agent
- AI 智能手机
- 智能家居
- 汽车 AI
- AR 设备
- 物理机器人
到 2035 年,AI 服务可能成为互联网用户的近乎普遍性工具。
2025–2035 年流量增长对比 #
思科给出了两种不同情景:
| 场景 | 2025–2035 年总流量增长 |
|---|---|
| 不考虑 AI | 4× |
| AI + Agentic AI | 6.6× |
| 相比无 AI 基线的额外增长 | 63% |
换句话说,AI 可能在传统互联网流量增长之外,再增加一层巨大的网络需求。
到 2035 年,AI 推理流量预计可能占整个互联网流量的约 25%。
📊 2029–2032 年可能成为 Agentic AI 爆发窗口 #
报告预计,2029–2032 年将成为 Agentic AI 加速普及的重要阶段。
在这一时期,AI 推理流量的 CAGR 预计约为 25%。
因此,网络流量增长未必只是平滑、线性的变化。
当企业和消费者同时开始大规模使用 AI Agent 后,网络可能进入一个明显的加速阶段。
而流量来源也将进一步多元化。
数字 Agent
│
├── LLM 推理
├── 搜索
├── API
├── 数据库
└── 云服务
物理 Agent
│
├── 机器人
├── 汽车
├── 智能家居
├── AR 设备
└── 工业系统
未来,物理 Agent 产生的网络负载甚至可能达到与数字 Agent 相当的规模。
🦾 物理 AI 将进一步扩大网络挑战 #
目前讨论 AI 网络时,人们往往首先想到聊天机器人、Copilot 和企业 Agent。
但未来的网络还需要承载大量物理世界中的 AI 系统。
例如:
- 自主机器人
- 智能汽车
- 工业系统
- AR 设备
- 智能家居
- AI 消费电子设备
这些系统可能持续交换传感器数据、模型输出、状态信息以及控制指令。
数字 Agent 可以在一次任务中产生大量 API 和推理请求。
而物理 Agent 除了需要这些通信之外,还必须与现实世界的设备保持可靠连接。
在这种场景中,网络延迟和可用性甚至可能直接影响物理操作。
因此,未来网络将越来越多地承载机器与机器之间的 AI 交互。
🛡️ AI 需要全新的网络安全与可观测性体系 #
思科报告最重要的结论之一是:AI 网络问题无法通过简单地增加带宽来解决。
真正发生变化的是整个网络行为模型。
AI 原生网络
│
┌────────────────┼────────────────┐
▼ ▼ ▼
流量行为 应用 SLA 安全
│ │ │
更长连接 TTFT / TPOT 加密 AI 流量
更低速率 推理延迟 新攻击路径
更多上行 Agent 延迟 Agent / Tool 链路
更多会话 可用性
传统网络监控主要关注:
- 带宽
- 丢包率
- RTT
- 吞吐率
- 连接数
而 AI 应用需要更多服务级指标:
- Time to First Token(TTFT)
- Time Per Output Token(TPOT)
- 端到端推理延迟
- Agent 任务完成时间
- 推理链路可用性
- 工具调用延迟
- Agent 到模型的通信可靠性
未来网络团队需要理解的不只是“网络是否正常”,还要知道网络性能如何影响 AI 应用本身。
🧭 AI 原生 WAN 的三项核心任务 #
思科的研究最终可以归纳为网络运营商和企业基础设施团队需要优先完成的三件事。
1. 建立 AI 流量识别能力 #
QUIC 加密以及 AI 服务日益分布式的部署方式,会让传统 DPI 的效果越来越有限。
企业需要新的机制识别 AI 相关流量,并测量其服务质量,而不能完全依赖传统应用层检测。
2. 重新设计容量规划模型 #
未来的带宽规划不能只考虑总流量增长。
网络工程师需要重新评估:
- 上行容量
- 下行容量
- 流量对称性
- 长连接数量
- 会话状态表容量
- 持续低速流量
- Agent 生成的流量峰值
- 不同区域的 AI 推理流量
过去“下行远比上行重要”的假设可能不再适用于 AI 原生网络。
3. 保护 Agent 与 LLM 之间的关键链路 #
Agent 到 LLM 的通信路径正在逐渐成为企业业务的关键基础设施。
这条链路需要具备:
- 高可用性
- 低且稳定的延迟
- 强安全控制
- 完整可观测性
- 网络故障恢复能力
- 合理的 QoS 策略
随着 AI Agent 开始承担核心业务流程,LLM 推理链路发生故障可能不再只是一个“网络问题”,而会直接演变成应用级业务中断。
🏁 WAN 正在进入 AI 原生时代 #
思科 2026 年的研究打破了一个常见认知:AI 对网络的影响并不只是需要更多带宽。
真正深刻的变化来自流量行为本身。
AI 推理会产生持续时间更长、速率更低、更加持久的网络流;大型 Prompt 和上下文会提高上行带宽需求;QUIC 加密会让流量识别更加困难;Agentic AI 会以软件级速度生成大量网络请求;而 Agent 与 LLM 之间的推理链路正在成为关键业务依赖。
在当前阶段,模型计算仍然是 AI 服务的主要延迟来源。
但随着 AI 推理硬件持续升级,网络延迟在端到端体验中的权重会不断提高。
未来十年的网络变化可以概括为:
AI 不只是消耗网络,而是在改变网络本身应该如何设计。
如果思科的预测最终成为现实,到 2035 年,AI 推理可能占据全球互联网约四分之一的流量;与此同时,Agentic AI 还可能让企业网络流量增长远超传统业务模式下的预期。
对于网络工程师而言,真正需要做的不是简单地“扩容”。
而是:
用不同的方式识别 AI 流量,用不同的模型规划网络容量,并把 Agent 与 LLM 之间的通信链路视为关键应用基础设施。
下一代 WAN 连接的将不再只是人与应用。
它还将连接:
Agent 与模型、Agent 与工具、Agent 与 Agent,以及越来越智能的机器与现实世界。