返回文章列表
中国电信如何用AI解决云网故障靠人工被动抢修、无线网优靠经验巡察、家宽装维现场作业耗时长问题的案例
📌 摘要
中国电信集团有限公司作为信息传输、软件和信息技术服务业(电信运营)行业的代表企业,通过引入AI技术实现业务升级。推出AI原生云网运营架构及5大产品,以网络大模型(TeleLLM)重塑监控维护、网络优化、家宽装维三大核心场景作业流程,核心成效包括云网故障自愈率超75%、网络隐患实现分钟级发现与处置、语音与视频等业务体验提升20%以上、家宽装维现场作业时长缩短60%以上、远程修复占比近40%、工具调用准确率达90%以上、领域知识答准率提升至95.2%、云网领域数据集规模超10TB、TeleLLM在GSMA Open Telco AI Benchmark位列全球第三国内第一等量化指标。
📖 本案例根据 中国电信报道整理 · 查看原文 →
企业背景
中国电信集团有限公司是国有特大型通信骨干企业,运营着覆盖全国的固网、移动网、云与数据中心一体化网络,是数字中国建设的主力军。随着高清视频、云办公、直播互动、车联网及低空经济等业务爆发式增长,网络规模与复杂度持续攀升,传统的"人工巡察、经验优化"运维模式已难以支撑。2026年7月17日,在2026世界人工智能大会期间,国务院国资委正式发布"百业智景"中央企业人工智能战略性高价值场景名单,中国电信"网络大模型赋能云网智慧营维场景"成功入选。支撑这一场景的是中国电信推出的AI原生云网运营架构及5大产品,包括云网知识管理平台、网络大模型、数字员工工厂等核心产品。在GSMA Open Telco AI Benchmark中,中国电信网络大模型(TeleLLM)位列全球第三、国内第一,标志着其探索出的央企核心业务AI赋能路径获得国际认可。
遇到的问题
云网运维长期处于"被动响应"状态:传统模式下,故障往往要等到用户投诉或告警大量触发后才被处理,跨系统排查靠人工串联,从发现到恢复链路长,网络隐患难以在事故发生前被捕捉。
无线网优依赖人工巡察与经验判断:网络优化过去靠工程师驱车测试、凭经验调参,只能做局部优化,难以兼顾全局;面对海量的网络指标、事件信令、区域体验和业务感知数据,人工分析存在明显能力边界。
家宽装维现场作业耗时长,上门成本高:宽带装维故障处理高度依赖工程师上门,无论问题大小都要跑一趟,一线作业效能受限,远程解决能力不足。
云网知识分散在专家脑子里,经验难以复用:网络运营涉及大量规章制度、历史案例与专家经验,这些知识长期以非结构化形态分散在不同系统和人员手中,新人上手慢、跨专业协同难。
跨专业跨厂商的长尾故障根因难定位:现网设备来自多家厂商、跨越多个专业,长尾故障的根因分析高度依赖少数资深专家,一旦人员不在岗,处理周期就会被拉长。
AI解决方案
1. 监控维护:构建"感知-分析-决策-调度-执行"闭环体系:依托网络大模型的多模态理解与复杂规划能力,实现运维模式从"被动响应"向"主动预防"的根本性转变,云网故障自愈率超75%,网络隐患实现"分钟级"发现与处置。
2. 网络优化:打造无线网优超级数字员工:推动优化范式从"人工巡察、经验优化"转向"AI主动发现、专家审核",从"人工测试、局部优化"转为"智能分析、全局优化",推动语音、视频等业务体验提升20%以上。
3. 家宽装维:AI深度融入装维全流程:将AI嵌入装维工作的每一个环节,现场作业时长缩短60%以上,远程修复占比近40%,一线作业效能与远程解决能力显著增强,推动装维队伍从传统"智家工程师"向高价值"智企工程师"转型。
4. 云网知识管理平台:把专家经验变成可训练的数据:构建高质量云网领域数据集,覆盖云网运营全场景、8大数据类型,规模超10TB,为模型训练提供充沛"燃料"。
5. 网络大模型TeleLLM:从知识增强走向复杂任务执行:实现从"能回答"到"能干活"的能力跃迁,工具调用准确率达90%以上,领域知识答准率提升至95.2%。
6. 数字员工工厂:把模型、知识与技能封装成可运营的AI能力:深度融合模型、知识与技能(Skill),依托主智能体引擎与动态沙箱保障数字员工确定性构建与运行;通过Agent Loop与上下文管理,实现云网Skill的敏捷创建与调度,推动AI无感渗透生产全流程。
实施效果
| 效果指标 | 实施前 | 实施后 | 改善幅度 |
|---|---|---|---|
| 云网故障自愈率 | 人工被动抢修 | AI闭环自愈 | 超75% |
| 网络隐患发现与处置 | 事后被动响应 | 主动预防 | 分钟级 |
| 语音、视频业务体验 | 人工巡察经验优化 | AI主动发现全局优化 | 提升20%以上 |
| 家宽装维现场作业时长 | 传统上门作业 | AI融入装维全流程 | 缩短60%以上 |
| 远程修复占比 | 以上门为主 | AI远程处置 | 近40% |
| 网络大模型工具调用准确率 | 知识问答阶段 | 复杂任务执行 | 达90%以上 |
| 领域知识答准率 | 基线水平 | TeleLLM | 提升至95.2% |
| 云网领域数据集规模 | 知识分散在专家经验中 | 云网知识管理平台 | 超10TB(8大数据类型) |
| TeleLLM行业评测排名 | — | GSMA Open Telco AI Benchmark | 全球第三、国内第一 |
| 运维模式 | 被动响应 | 感知-分析-决策-调度-执行闭环 | 根本性转变 |
| 装维队伍定位 | 传统智家工程师 | AI赋能 | 向高价值智企工程师转型 |
技术解析
"网络大模型"的关键不在会聊天,而在会调用工具:通信运维的核心动作是查配置、下指令、核数据,这些都要落到系统里。TeleLLM把工具调用准确率做到90%以上、领域知识答准率做到95.2%,意味着它已经从"问答助手"变成"能执行复杂任务的操作员"——这一步跨越,是AI能否真正进入生产流程的分水岭。
"10TB云网数据集"是TeleLLM跑在行业前面的真正原因:通用大模型不懂云网语义,因为没有见过这些数据。中国电信把覆盖全场景、8大数据类型、规模超10TB的高质量数据集先建起来,才有了GSMA评测全球第三、国内第一的结果。行业大模型的壁垒从来不是参数,而是数据。
"数字员工工厂"解决的是AI规模化复制的问题:一个场景跑通不难,难在几百个场景都能跑通。数字员工工厂把模型、知识、技能封装成可运营的AI能力,用主智能体引擎和动态沙箱保障确定性,本质上是把"AI应用开发"从项目制变成流水线——这才是75%自愈率能在全网铺开的前提。
经验启示
1. 运营商AI必须建在"自有数据"上,不能指望通用模型:云网运维的专业术语、告警逻辑、处置规范,通用模型一概不懂。中国电信先把10TB行业数据集建起来,再做网络大模型,顺序不能颠倒——数据是行业AI的地基。
2. AI要挑"高频、可闭环、能自愈"的场景先做:监控维护、网络优化、家宽装维三个场景的共同点是每天都在发生、动作可以标准化、结果可以量化。这三个场景跑出了75%自愈率、20%体验提升、60%时长压缩,反过来又验证了模型的价值,形成正循环。
3. 从"被动响应"到"主动预防"是运维AI最大的价值跃迁:缩短处理时间只是线性改善,而把发现环节从"等投诉"前移到"系统主动识别",是数量级的改变。衡量运维AI做得对不对,要看"有多少问题在用户察觉之前就被处理掉了",而不是"处理得多快"。
企脉AI独家观点
中国电信这个案例,最值得通信与基础设施行业老板琢磨的,不是"云网故障自愈率超75%"这个漂亮数字,而是它回答了一个传统行业AI落地的老问题:企业搞AI,到底应该"先买一套通用大模型工具"还是"先把自家的行业数据建起来"?
答案是先把自家数据建起来。中国电信没有去采购一个通用大模型就指望它看懂云网,而是先花力气建了覆盖全场景、8大数据类型、规模超10TB的云网数据集,才训练出TeleLLM——工具调用准确率90%以上、领域知识答准率95.2%、GSMA评测全球第三国内第一。原因很简单:通用模型没见过这些数据,压根听不懂"波束级参数寻优""长尾故障根告警"这些行话。数据不自建,模型就永远是个"刚毕业的高材生"——聪明,但不懂你家的业务。
更值得学的是它的落地顺序。中国电信没有一上来就搞个炫酷的AI大屏,而是挑了监控维护、网络优化、家宽装维这三个每天都在发生、动作能标准化、结果能量化的场景:故障让它自己愈,网优让它主动找问题,装维让它先远程判一判。这三个场景跑通之后,才用"数字员工工厂"把能力封装成流水线,向几百个场景复制。自愈率75%、体验提升20%、现场作业时长压缩60%——这些数字不是某个单点突破换来的,是"数据地基 + 高频场景闭环 + 能力流水线"三步走出来的。
对国内大量运营商、能源管网、交通路网、园区运营等基础设施型企业而言,中国电信的参照意义在于:别总想着"先买一套AI平台解决所有问题"——基础设施行业的AI落地,必须先把自家多年积累的运行数据、专家经验、处置案例标准化成可训练的数据资产,再挑"故障处置""巡检优化""现场作业"这种高频可量化的场景做第一个闭环,验证有效后用智能体工厂横向复制。 基础设施AI最值钱的,永远不是"大屏有多炫",而是"有多少故障在用户打电话投诉之前就被系统自己处理掉了"——把这条难走的路走通,比花大钱做演示系统更要紧。