9月12日,蓝鲸社区活动·上海站在模速空间圆满举办,来自华东区域的社区伙伴齐聚上海交流。感谢每一位来到现场的社区伙伴,也感谢大家一直以来对蓝鲸社区的关注与支持。
本次活动以“从自动化到智能体”为大主题,围绕“企业研发运维AI Agent落地实践”展开,来自腾讯IEG、嘉为蓝鲸、国联民生证券、基调听云的技术专家围绕SRE、AgenticOps、金融行业实践、可观测性治理及运维现场智能执行等议题展开分享,探讨AI Agent在研发运维领域的一线实践与思考。
活动在腾讯蓝鲸 SRE 总监杨军的开场致辞中拉开帷幕。
杨军回顾了蓝鲸从腾讯内部诞生,从支撑游戏业务大规模服务器自动化运维,到逐步形成覆盖配置管理、监控告警、故障自愈、CI/CD、AI Agent、AI辅助运维等能力的十余年发展历程。他指出,大模型正在为研发运维带来新的可能,运维也正从自动化进一步走向智能体协同Agent自主决策,并期待通过此次上海站活动,与华东地区的行业伙伴共同交流AI运维的新实践。

演讲嘉宾:王文兴(腾讯 IEG)
王文兴系统分享了腾讯 IEG 在 SRE Agent 方面的实践路径,将落地方式划分为L1 预设流程 AI 化、L2 A2A 自主编排、L3 SRE 数字分身三类。他特别强调,三条路径并非线性递进,而是可以并行建设、动态转化:高频稳定的 L2 场景可以进一步沉淀为 L1,L3 中成熟的操作能力也可以逐步固化为标准技能。
在实践层面,他分享了 Game CI 与 Game CD 中的多个真实场景。在 CI 阶段,Agent 结合业务源码、部署配置及测试结果,对 K8s 资源配置进行分析和优化;在正式环境发布前,Agent 自动聚合监控、日志、Crash 等多源数据完成风险评估,让原本约 60 分钟的人工评估,转变为 3–5 分钟的报告阅读与确认。测试环境则引入更接近“数字分身”的服务模式,承接日志获取、版本发布、状态查询等高频琐碎任务,减少 SRE 时间碎片化。
在价值度量方面,他提出“AI 工时”核算思路,以 ReAct 过程中模型推理与工具执行为基础,并结合执行时长折算、收益上限、用户采纳率及安全合规等约束,让 Agent 创造的价值能够进一步被量化,并为后续 ROI 评估提供依据。

演讲嘉宾:张敏(嘉为蓝鲸)
张敏从IT服务管理和一体化运维场景的企业实践出发,分享了 Agentic Ops 如何真正进入既有运维体系。他提出一个核心思路:AI Agent 不能只停留在对话入口,而应嵌入真实业务流程,成为流程中的“AI 员工”。
在 ITSM 场景中,嘉为蓝鲸将工单信息审核、智能提单、智能分派、辅助诊断、自动化执行等 AI 节点嵌入原有服务流程,并通过工单、知识和语料的持续沉淀形成数据循环,推动服务左移和处理效率提升。
在一体化运维场景中,则结合日常运维的操作工时、发生频率和可节省时间等因素,建设了查询、发布、告警分析、智能巡检、标准操作、监控运营等多类智能体场景。实践中也逐步形成一个重要认识:智能体建设与运维基建治理需要双向促进——Agent 能力越深入,越会暴露 MCP、数据和基础设施治理中的短板,而这些基建的完善又会反过来提升 Agent 的效果。
张敏强调,Agent 落地应从既有业务流程中的真实问题出发,先找到真正需要解决的问题,再判断 AI 应该如何介入,而不是为了使用 AI 而创造场景。

演讲嘉宾:赵茂祥(国联民生证券)
赵茂祥从金融行业 SRE 的真实实践出发,分享了从标准化、自动化到 Agent 的协同演进路径。他认为,标准化让知识可沉淀、可查询、可复用,自动化让操作可重复、可审计,而 Agent 则在这些工程能力之上理解目标、获取事实、处理不确定性。
因此,Agent 并不是取代已有的自动化体系,而是建立在标准化和自动化底座之上的进一步延伸。
在运行机制上,他提出让 Agent 从“对话驱动”走向“事实驱动”:先理解用户目标、补全上下文、定位对象,再不断获取日志、状态等运行事实,并据此决定下一步行动。核心原则是基于事实、不做臆断——模型可以提出假设,但不能定义事实,所有事实都需要验证。
对于 Agent 无法完成的问题,也不是简单返回“处理失败”,而是将已经确认的事实、排除项、不确定项及建议形成“证据包”,再转交给 SRE 继续处理。排障场景的核心是收敛不确定性,而交付场景则是围绕明确目标构建确定性。
同时,他还分享了权限收敛、风险分级、执行留痕、停止机制等工程治理思路,并提出 Agent 的价值度量不必一开始追求“大而全”,而应先让用户真正使用,再基于活跃度、请求类型和实际效果持续挖掘高价值场景。

演讲嘉宾:王雅志(基调听云)
当 AI Agent 从问答工具走进生产业务,企业关注的问题也从“回答得对不对”,进一步变成“运行是否稳定、结果是否可信、变化是否可验证”。
王雅志将这些挑战总结为运行盲区、结果盲区和进化盲区三类问题:Agent 到底慢在哪里、错在哪里?模型调用成功是否意味着业务成功?一次优化之后,效果究竟提升了还是发生了退化?
围绕这些问题,他提出覆盖 Agent、用户、AI 应用与编排、模型、基础设施、安全的六层可观测体系,并通过 User、Session、Trace、Observation 等对象,将一次请求从用户入口到最终业务结果的运行证据关联起来,从而支撑问题回溯、责任边界定位和效果评估。
在此基础上,他进一步提出 SPEC 治理框架,从安全、性能、效果、成本四个维度衡量 Agent 的生产运行状态。其核心观点是:模型调用成功,并不等于业务成功。只有将生产现场记录、结果评估、优化和回归验证连接成闭环,才能真正判断一次 Agent 优化是否有效。
他还结合银行智能服务、保险核保理赔以及大型集团统一治理等场景,分享了不同业务对稳定性、结果验证和统一标准的差异化要求。

演讲嘉宾:罗扬(腾讯蓝鲸BKLite PMC成员)
罗扬从一个现实问题切入:在企业本地算力有限、模型能力受限的情况下,如何提高 Agent 故障排查的成功率和可信度?
传统做法往往只把单点告警交给 Agent,再让它不断调用工具恢复现场上下文。但对人来说,看到告警的同时,往往已经能够看到日志、堆栈、关联对象和仪表盘等大量现场信息。如果这些已经存在的上下文没有同步给 Agent,Agent 就不得不重新“探索”一遍,也增加了错误和幻觉累积的可能。
因此,他提出:把运维现场本身作为 Agent 的执行入口。将监控大屏、日志页面、专业仪表盘等页面上下文直接提供给 Agent,让它一开始就能“看到人看到的内容”,再结合 Skills、Tools、知识与运维平台能力继续向下排查,从而减少上下文恢复的步骤与时间,也降低故障排查对模型能力的过度依赖。
在实践过程中,他还分享了“运维档案(Memory)”的探索:将经由 Agent 的操作、故障排查和变更过程持续沉淀,形成包含历史问题、操作记录和资源上下文的运维记忆。相比只描述当前配置状态的 CMDB,这类运维档案能够保留更丰富的历史运行信息,并在下一次类似问题出现时为 Agent 提供参考。
技术的价值在于落地,社区的力量在于连接。
蓝鲸社区首次上海线下活动至此圆满落幕。感谢每一位嘉宾的精彩分享,也感谢每一位到场伙伴的参与和交流,让这场特别的上海之约更有意义。
未来,蓝鲸社区将继续走向更多城市,连接更多技术同行者,分享更多一线实践,让交流持续发生,让经验不断沉淀。
下一站北京,继续同行。
嘉为蓝鲸入选《软件研发效能・2025 中国年度调查报告》优秀案例,标杆实力再获认可!
2026-01-23
查看详细
点击查看!嘉为蓝鲸2025年成绩单:筑牢长期合作安全屏障
2026-01-16
查看详细
智创湾区,研运先行:嘉为蓝鲸受邀出席澳门国产化产品应用交流会
2025-12-26
查看详细
嘉为蓝鲸获评“2025年度数字化星级标杆服务商”,以全栈研运解决方案赋能长三角企业数智转型
2025-12-26
查看详细
信通院权威认证:嘉为蓝鲸携手两大客户入围“软件工程智能化领航者”创新应用实践
2025-12-19
查看详细
信通院权威认证:嘉为蓝鲸携手客户入选“AI云系统安全稳定运行”创新实践案例
2025-12-19
查看详细
申请演示