首页

/

【秋季发布】嘉为蓝鲸可观测中心重磅升级:从全景透视到智能根因,构建“观测-定位-处置”完整闭环

发布日期:2026-09-29 15:13:59

分享到

当系统规模跨越临界点,运维团队面临的真正挑战,早已不再是“如何收集更多数据”,而是“如何从海量噪音中提炼出决定性的洞察”。告警风暴常常掩盖了真实的故障根因,繁琐的配置规则消耗了宝贵的排查精力,而割裂的视图则让跨域问题的定位举步维艰。

嘉为蓝鲸可观测中心·鲸眼,涉及五大核心产品模块:观测中心、监控中心、告警中心、日志中心与应用性能观测中心(APM),始终致力于打破数据孤岛与运维瓶颈,进化为运维人员的“智能外脑”与“决策导航仪”。本次秋季焕新,我们不再局限于单一功能的叠加,而是聚焦于“化繁为简”与“智能赋能”。通过构建全景洞察的业务拓扑、打通动态告警联动,以及提供多维数据的可视化编排,我们正帮助企业将资深的运维经验转化为标准化的系统能力。让每一次故障排查都精准高效,让业务稳定运行坚如磐石。

01 发布总览

本次秋季大版本,围绕“看得全、判得准、接得快、管得住、理得清”五大主线,对全栈可观测能力进行体系级重构,涵盖五大模块、六大核心能力升级,覆盖从业务全景到应用链路的全栈可观测场景。

02 全景观测:不止于“看见全貌”,更在于“看透根因”

在复杂的多云与混合架构下,业务全景早已不是简单的连线图。鲸眼观测中心对业务全景拓扑进行了从底层视觉到顶层算法的深度重构,重新定义“全景洞察”——它不仅要求你看清每一处依赖,更要求你看透每一次异常。

1)视觉重构:多维聚合与降噪,还原清晰全景

真正的洞察,始于清晰的全局视野。本次发布,我们彻底打破了“平铺直叙”的视觉瓶颈:

  • 双模驱动,按需聚焦:首创「排障模式」与「全量模式」。排障模式下,系统自动收敛无关的正常资源,让异常节点及其上下游链路瞬间“C位出道”;全量模式下,完整呈现业务资源脉络,满足宏观架构审视。
  • 多维聚合,空间跃迁:面对海量实例,通过集群菱形聚合、按应用划分的服务层二级聚合等策略,将复杂架构收敛为高密度的蜂窝阵列。空间利用率大幅提升,让关键信息在方寸之间清晰可溯。
  • 连线降噪,路径显影:告别“蜘蛛网”式的视觉干扰,单击节点即可高亮关键传播路径并附带流动效果,让故障的上下游影响范围一目了然。

2)智能破局:引入风险评分,精准锁定根因

看清全貌只是第一步,在告警密集爆发时,如何从海量节点中快速锁定真正的“元凶”?

观测中心在全景拓扑中重磅注入「拓扑风险评分」能力。系统内置 TIC(Time-Impact-Criticality)算法,综合时间因果(首发与持续时长)、拓扑影响(层级与上下游范围)、告警表现(数量与严重等级)三大维度,为节点计算 0-100 分的精准风险评分。

Top 3 高风险节点将以悬浮卡片直观呈现,并附带详尽的评分依据。无需人工逐个排查,点击卡片即可一键高亮并居中定位目标节点,实现从“人找异常”到“智能推根因”的跨越。

3)交互升级:沉浸式排查体验,上下文永不丢失

洞察的最终目的是行动。为了让分析结果无缝融入真实的排查工作流,我们打造了极简的交互闭环:

单击节点弹出轻量级的紧凑胶囊信息卡片,支持一键打开概览或唤起右侧滑动的聚合实例列表。运维人员无需离开当前拓扑视图,即可完成从宏观概览到微观实例的无缝下钻,排查上下文永不丢失。

从“碎片化排查”到“全景式洞察”,观测中心将资深运维的排障逻辑沉淀为智能算法。依托全景拓扑与风险评分的双重赋能,助力团队将故障平均修复时间(MTTR)压缩至分钟级,让业务运行稳如磐石。

4)健康度量:构建全局健康基线,系统状态一目了然

面对海量监控指标与告警风暴,运维深陷排查泥沼,业务方则面临数据认知壁垒,系统整体健康状况亟需一份化繁为简的统一“体检报告”。

观测中心重磅推出「业务健康度管理」能力,将复杂的底层监控数据科学转化为直观的0-100分健康评分(健康/警告/严重/致命),让系统健康从晦涩难懂走向一目了然:

  • 全局基线,统一标准:支持建立企业级全局健康度规则基线,通过统一“指标类型映射”为所有业务提供一致的计算标准;“全局继承”与“业务独立配置”双轨并行,兼顾规范统一与个性化诉求。
  • 科学建模,多维加权:支持自定义9大标准拓扑层级权重,按对象模型与实例数量自动换算;针对主备/多活等复杂架构内置智能集群收敛规则;关键层级更可配置“熔断”属性,核心链路出现致命故障时直接触发系统级压制,避免真实风险被平均分掩盖。
  • 严谨发布,安全可控:引入企业级发布流程,支持草稿与版本管理;发布前自动执行全面体检,缺失关键配置触发“阻断项”禁止发布,存在隐患触发“风险项”二次确认;并可一键预览受影响业务清单,确保规则变更精准可控。

5)生态融合:打破孤岛,外部监控一体纳管

真正的全景不应局限于平台边界。观测中心全面开放数据生态,新增支持外部 APM、RUM、NPM 等监控系统的指标与告警融合打通:

  • 异构纳管,一屏呈现:兼容主流外部监控协议,外部应用、端侧体验与网络路径自动映射入全景拓扑,实现跨系统资源同图同框。
  • 指标对齐,告警收敛:外部指标与告警统一接入全局基线与事件流,深度参与 TIC 风险评分与异常收敛,跨系统告警风暴一屏统管。
  • 全链拼接,健康联动:智能拼接端到端调用链与网络路径,外部异常实时纳入业务健康度统一评分,彻底消除跨系统观测盲区。

03 业务观测:为业务连续性保驾护航,让跨系统交易清晰可见

观测中心新增面向跨系统交易链路的业务级监控能力,包含业务墙、场景墙与业务链检索三大核心模块,将可观测视角从“资源与拓扑”进一步延伸至“业务交易与调用链”。

1)业务墙:一屏看清业务级上下游调用

业务墙为每个业务系统设置独立观测卡片,聚合呈现交易量、平均耗时、成功率、业务失败数与技术失败数及告警状态,异常业务自动凸显,还可一键筛选“仅展示有告警的业务”。点击任一业务端下钻,可在交易分析、交易明细、多维分析、业务拓扑、统计报表五大视图间切换,既看业务层面的上下游调用关系与运行指标,也通过返回码、交易量、平均耗时的TOP排行快速锁定异常交易。

2)场景墙:锚定具体场景,实现业务场景可观测

场景墙将可观测性落到“创建订单”“支付”等具体业务场景。场景详情页一屏呈现交易量、成功率、耗时等核心指标,并通过场景拓扑以业务拓扑、服务拓扑双视角,完整描绘一笔交易跨系统、跨服务的业务执行过程;结合交易类型、交易结果等过滤条件,可查看对应明细。

3)交易检索:还原一笔交易的全链路

输入一个号,调出整条链。面向单笔交易排障,交易明细检索支持按全局流水号、子流水号、traceId、交易结果、返回码、响应耗时等条件组合查询,并同步给出交易趋势分析与明细列表;从一笔交易一键下钻至关联调用链与上下文日志,让“人找线索”真正变为“系统指路”。

04 监控:从“被动监控”到“智能洞察”的全面进化

随着业务架构复杂度攀升,监控视角必须从“单点盯防”升级为“全栈透视”。从底层主机到核心组件,再到跨域网络,任何盲区都可能引发故障蔓延。

鲸眼监控中心全面打通数据采集、智能分析与多维对比的闭环,消除数据孤岛。以更智能的算法与更直观的看板,为您构建一张会思考的业务健康防护网。

1)开箱即用:内置监控体系,零配置启动

告别繁琐的插件安装与指标梳理,我们为您预置了企业级的监控能力:

  • 六大主流组件内置支持:原生集成ES、MySQL、Redis、Nginx、Kafka、Zookeeper采集插件,覆盖从数据库到中间件的核心栈,SQL类插件新增MSSQL、达梦(DM)、OceanBase(MySQL/Oracle 双模式)支持,与Oracle、MySQL、DB2等既有类型协同,全面覆盖主流与国产数据库监控场景。
  • 内置组件仪表盘:配合内置插件,同步上线 ES、MySQL 等组件的专属监控仪表盘,提供开箱即用的可视化分析体验。
  • 策略模板预置:内置完善的指标体系(生死指标、告警指标、分析指标)与监控策略模板,预设合理阈值,无需人工反复调优,实现“安装即监控”。

2)洞悉网络脉动:让数据流动透明化

全新上线「网络流量Flow」分析,打破多厂商网络数据孤岛,提供从宏观趋势到微观会话的端到端流量可视化,实现网络故障分钟级定位与科学容量规划。

三大核心能力:

  • 全协议融合,统一流量视图:原生兼容NetFlow、sFlow、IPFIX等主流流协议。自动完成五元组清洗、规范化与应用映射,将异构网络数据转化为全局统一的标准资产。
  • 多维交叉分析,会话级下钻:支持从“源 (Source)”、“目标 (Destination)”、“网络流 (Data Stream)”三大维度灵活过滤与聚合。发现异常指标后,支持一键下钻至具体数据流会话,完整还原通信上下文。
  • 引入P95统计,拒绝“平均数”陷阱:深度集成P95利用率与速率模型。精准捕捉链路真实负载水位,有效剔除偶发流量毛刺,让数据反映真实网络状态

赋能三大实战场景:

  • NOC 故障排查(分钟级锁定元凶):专线突发拥塞?无需逐台登录设备。通过时间窗口与接口筛选,结合多维分析,迅速定位占满带宽的异常主机或应用。
  • NPM 容量规划(让扩容有据可依):链路是否需要扩容?结合长周期(如30天)的P95指标与应用流量占比报表,清晰洞察业务对网络资源的消耗模型,科学制定扩容计划。
  • SOC 安全溯源(异常流量快速响应):核心端口流量异常?通过“目标IP + 目标端口”快速过滤,在数据流视图中精准揪出高频短连接、扫描攻击或可疑外联会话。

3)深度可视:主机监控看板,一屏掌握健康全景

为了让运维人员快速定位主机瓶颈,我们在主机实例详情中全新打造「监控看板」页签,默认置顶展示:

  • 四大诊断模块:结构化呈现「CPU 与负载」、「内存与 Swap」、「存储与 I/O」、「网络与连接」,从宏观到微观层层递进。
  • 核心指标卡片:首屏展示系统启动时间、CPU/内存/磁盘使用率等关键指标,支持Linux、Windows、AIX多操作系统自适应。

4)灵活分析:多维指标对比,洞察更自由

排查故障还在逐条查指标?试试三连对比一图锁定根因指标检索多维对比分析,支持目标、时间、指标三重维度自由对比,让运维排错从“单点观测”迈向“全局洞察”。

05 告警:让降噪更精准、处置更从容

在依赖关系日益复杂的分布式架构下,一次故障往往引发成百上千条告警的连锁爆发,告警管理早已不是简单的“接收与转发”。

鲸眼告警中心对告警治理能力进行了从智能降噪、自动处置到精准分派的系统性升级,重新定义“告警运营”——它不仅要求你精准收下每一条有价值的告警,更要求你从容完成每一次处置与复盘,致力于将您从被动的“告警接收器”,升级为掌控全局的“故障指挥官”。

1)动态屏蔽:精准收敛衍生告警,告别“无效刷屏”

告警屏蔽规则迎来了“智能联动”升级,现在,你可以轻松设定联动规则:当系统检测到满足特定条件(如“主机Ping不可达”)的告警时,会自动“记住”该告警携带的全维度特征(如告警对象、指标、名称等),并在接下来的指定时间内,自动拦截所有指向该特征的衍生告警。

2)多维视图:全局/业务/对象,千人千面的告警掌控

面对海量活动告警,单一的列表视图往往难以满足NOC、业务负责人、DBA等不同角色的排查诉求。鲸眼可观测平台的活动告警列表全新支持「全局、业务、对象」三种视图模式无缝切换:

  • 全局视图:纵览整体态势,按状态直观统计全量活动告警。
  • 业务视图:按业务维度聚合,左侧两层拓扑快速定位故障业务,右侧精准展示该业务下的告警分布。
  • 对象视图:按对象模型及实例深度下钻,从模型到实例层层递进,实现精细化告警管理。

三种视图按需切换,让不同角色的运维人员都能在最熟悉的维度里,快速锁定目标告警。

3)自动化处理:已知故障自动修,未知故障自动查

有固化处理流程的常见告警,告警中心的自动化处理早已能“自动修”:日志过大自动清理、磁盘满自动释放、服务异常自动重启、故障节点自动剔除……“已知问题”秒级处置,无需人工介入。

新增的「诊断分析」模式让自动化同样支持“自动查”:面对需要研判分析的故障,系统自动执行运维诊断流程,诊断结论与各步骤完整记录至告警详情页。你打开告警的那一刻,根因分析已经摆在桌面上,从“处理”到“诊断”,自动化完成真正闭环,凌晨 3 点的排障复盘,到此为止。

4)通知分派各司其职:“领单人”与“观众席”不再强制绑定

“谁处理就通知谁”曾是简单直接的默认默契。但随着运维分工日益精细,“谁来处理”与“谁来知晓”往往不再是同一批人。

现在,告警分派规则将两者精准解耦:分派人员专属领单,锁定告警唯一处理责任人,故障面前没人“击鼓传花”;通知人员开设观众席,上级、值班搭档、业务负责人实时同步,一个不落、也不多吵。

06 日志:从“海量数据”到“价值洞察”的跃迁

鲸眼日志中心致力于将杂乱的原始日志转化为结构化的业务洞察,让每一条日志都成为故障排查的线索,而非数据的负担。

1)字段统计:一键透视数据分布,告别“盲查盲选”

面对陌生的日志主题,运维人员往往需要反复尝试检索条件,才能摸清字段的取值分布。

现在,全新上线「日志字段统计分析」能力。只需点击任意字段,系统即可自动生成可视化的统计视图:

  • 字符串字段:自动展示 TOP 5 值的时序分布与占比,快速识别异常值与高频模式。
  • 数值字段:智能生成数值分布直方图,最大值、最小值、中位数一目了然,轻松发现数据离群点。

2)数据关联:打破数据孤岛,实例日志一键直达

过去,查看某台主机的日志,需要手动输入IP、筛选主题、拼凑查询条件,操作繁琐且容易出错。本次引入「日志数据关联」能力。通过配置CMDB字段与日志字段的映射规则,建立日志数据与资产实例的深度关联:

  • 规则映射匹配:系统基于实例的CMDB属性(如IP、主机名),通过配置日志字段和CMDB实例字段的映射规则去关联对应的日志数据。
  • 实例详情直达:在任意实例详情页,新增“日志数据”页签,无需任何检索操作,即可直接查看该实例关联的所有日志,真正实现“所见即所得”。

3)划区检索:时间轴框选聚焦,毫秒级锁定异常区间

在长达数天的日志趋势图中,想要定位某几分钟的异常数据,往往需要反复调整时间选择器,操作极其不便。

现在,日志与APM检索页面全新支持「划区域检索」能力:

  • 框选即查:在直方图下方的时间轴上,长按鼠标框选任意时间区间,即可快速检索该时段内的日志数据。
  • 聚焦下钻:支持“聚焦检索”模式,框选后自动缩放时间窗口,层层下钻,将排查范围从“小时级”精确到“秒级”,让异常定位快人一步。

4)分级展示:直方图多色堆叠,告警等级一目了然

传统的日志直方图仅展示总量,无法直观反映Fatal、Error、Warn等不同等级日志的分布情况。当日志量突增时,用户仍需进入明细才能判断问题严重程度。

本次发布,直方图支持「日志分级展示」能力:

  • 智能分级染色:系统内置默认正则规则(支持自定义),自动识别原始日志中的等级关键字,将直方图升级为多色堆叠柱状图。
  • 灵活交互控制:支持一键隐藏/显示特定等级,从图例快速复制等级条件发起检索。让运维人员在宏观趋势中,瞬间识别出哪一分钟的“红色(Fatal/Error)”日志在飙升,快速锁定故障根因。

07 APM:从“单点观测”到“全链路透视”的跨越

微服务架构下,核心业务请求横跨多应用系统。然而,传统应用隔离机制常让运维陷入“只见树木,不见森林”的困境:链路断裂、重复检索、数据难寻。

鲸眼应用性能观测中心(APM)迎来三大核心升级,打破应用孤岛,让调用链分析更全局、更敏捷、更精准。

1)调用链透视:跨应用追踪与智能检索,秒级锁定根因

面对动辄上百个Span的复杂微服务链路,人工滚动排查往往效率低下。本次更新,鲸眼APM调用链检索迎来核心体验升级,打破应用边界,让故障定位快人一步。

  • 跨应用追踪:打破孤岛,全景还原

一键开启同业务跨应用追踪。瀑布图新增应用边界标识,拓扑图支持按应用快速聚焦高亮,让跨系统的长链依赖关系一目了然。

  • 智能检索定位:告别滚动,一键直达

全局搜索框支持服务/接口模糊匹配;新增“失败调用”一键定位,自动过滤并聚焦异常Span;支持“上一个/下一个”多视图(瀑布图/拓扑/列表)联动高亮,排查上下文永不丢失。

  • 核心指标聚合:链路状态,一屏掌控

顶部直观展示总服务数、总Span数等关键指标,图例布局全面优化,让链路复杂度与整体性能表现一眼可知。

2)检索收藏夹:高频条件一键复用,团队经验高效沉淀

复杂故障排查常需组合多重条件,手动重复输入效率低,优秀经验也难以沉淀。

「Trace检索收藏夹」全新上线:支持一键保存与复用复杂检索条件,并提供个人与公共收藏切换,让排查经验在团队内高效传承。

  • 一键收藏,秒级复用:支持将包含应用、Trace ID、耗时范围及高级检索在内的完整查询条件保存为收藏卡片。
  • 个人与团队共享:支持“个人收藏”与“公共收藏”灵活切换。团队可将经典的排障查询模板设为公共收藏,让新人也能站在专家的肩膀上快速定位问题。

3)高级检索:多维条件灵活组合,海量数据精准过滤

原有的自定义参数配置繁琐且仅支持精确匹配,难以应对复杂多变的排查诉求。

我们将“自定义参数”全面升级为专业级的「高级检索」引擎:

  • 丰富的操作符支持:告别单一匹配。针对字符串、数字、耗时等不同类型字段,全面支持“包含/不包含”、“存在/为空”、“大于/小于”等丰富操作符,满足各种边缘场景的精准过滤。
  • 标签化直观管理:所有添加的检索条件均以标签形式直观展示在列表上方,支持一键清空或单独删除,并自动触发实时检索,让数据探索如丝般顺滑。

08 结语

嘉为蓝鲸可观测中心秋季版本以全局视野为锚点,以精准感知为驱动,助力企业:

  • 从“局部观测”拓展为“全景透视”
  • 从“事后复盘”前置为“智能预测”
  • 从“工具支撑”进化为“稳定基石”

秋实盈枝,智见未来。嘉为蓝鲸将持续打磨“采集-检测-分析-处置”的完整闭环,将资深运维经验沉淀为标准化的系统能力,让可观测体系真正成为每一位运维人员的“智能外脑”——屏蔽无效噪音,锁定核心根因,守护业务连续。


在线咨询

预约演示

微信咨询

服务热线

020-38847288

置顶

申请演示

请登录后在查看!