跳转至

AIOps

AIOps 接手告警中心已经聚合好的事件,产出根因分析,以及人接下来该跑的诊断步骤。

AIOps

这个模块建立在三条铁律上

  1. 模型只做脑,不做手。 现阶段 AI 只分析和建议,只执行只读诊断,不对设备配置做任何变更。执行由人来。
  2. 诊断只读,且强制校验。 Runbook 命令在保存时逐条校验,只接受 show / display / ping 一类命令。
  3. 不脱敏就不出网。 设备数据在任何外部调用前强制脱敏,且是 fail-closed:脱敏无法确认就不发送。本地端点则数据完全不出内网。

AI 工单

模块标题是 AI Remediation,左侧依次是 AI 工单告警日志审计知识库

一个事件变成一张 AI 工单:时间、级别、状态、主机、事件、告警数、置信度,以及 AI 给出的根因。顶部计数依次是处理中待关闭已关闭AI 采纳率AI 成本——用本地端点或内置启发式引擎时成本恒为 $0.00,而新装实例默认就是后者。

筛选:处理中 / 待接管 / 待关闭 / 已关闭 / 全部

工单里能看到建议的根因、诊断步骤、它据以推理的相关配置段,需要上下文时还能看完整配置

自动诊断是个复选框,默认关闭:你不打开它,就不会有任何东西去碰你的设备。「紧急停止」全网停掉自动诊断,它被刻意做成页面上最醒目的控件。

分析引擎

「LLM 设置」选择分析引擎:

  • 本地端点——一行一个,格式为 地址 模型名。按顺序尝试,第一个可用的生效,所以第二行就是主备容灾。发往本地端点的数据不出内网。
  • 托管模型(Claude、OpenAI)需要 API Key。Key 加密存储,不回显。

知识库

有两样东西让分析随时间变好,而且都在本地:

Runbook 是每类告警的诊断命令集,按厂商区分。占位符 {peer}{ifname}{vrf}{hostname} 在执行时按告警对象自动填参,参数解析不出来的那一步会被跳过,而不是错着跑。命令有 VRF 双形态时写作「全局命令 || VRF形态命令」,能判定对象 VRF 时自动用后者。

Runbook 可标记为已人工审核并因此锁定:AI 的自动回写不会覆盖工程师已经审过的命令集。

先例(RAG) 是工程师采纳过的历史根因。在工单里点「采纳」即入库;下次分析同类告警时,自动检索最近 3 条同类型先例注入上下文。检索完全在本地完成,不需要把任何数据发出去。