L5 全自动闭环运维 V5.0 自研产品 · 私有化部署 · 国产自主可控

安管家 AI智能运维管理系统

AI Intelligent Operations System · 新一代L5级全自动闭环运维平台
系统检测到问题 → 自己分析 → 自己定位根因 → 自己执行修复 → 自己验证结果
整个过程人不需要介入,除非你想审批高风险操作。
99.5%
告警降噪率
10000条 → 约50条
3min
平均故障修复
MTTR
85%
自动修复成功率
无人工干预
23
采集器种类
覆盖全栈
1000+
单人运维节点
人效上限
L5 全自动六步闭环引擎(V5 核心架构)
① 全面感知
采集层
Agent v3 + eBPF
SNMP / JMX / APM
K8s / Docker API
TCP连接感知
Windows深度采集
日志自动发现
② 实时分析
分析层
动态基线检测
拓扑级联关联
时序数据分析
日志模式识别
多维度聚合
告警去重降噪
③ 根因定位
诊断层
200+规则库匹配
拓扑传播分析
因果推理引擎
历史案例检索
堆栈/慢查询分析
置信度评分输出
④ RCA取证
全因分析层 V5 新增
异常现场快照采集
进程堆栈自动抓取
日志证据链关联
空间/逻辑关联
知识图谱路径搜索
多级因果推断 L1~L3
⑤ 决策执行
执行层
风险矩阵评估
自动/审批双通道
事务性执行引擎
SSH远程操作
脚本动态生成
失败自动回滚
⑥ 验证学习
闭环层
修复效果自动验证
指标对比确认
失败升级人工
经验写入知识库
规则自动优化
用户行为学习
核心能力矩阵

🧬 eBPF 内核级无侵入采集

  • 挂载内核探针,无需修改应用代码
  • TCP连接全生命周期追踪
  • 进程级系统调用延迟分布
  • 自动构建服务间依赖拓扑
  • 网络包级别丢包/重传检测

💻 Windows 深度采集

  • WMI / ETW 事件追踪,原生监控
  • 自动识别中文网卡名
  • Windows 服务状态深度监控
  • 事件日志自动采集
  • 图形化安装程序,一键部署

🌐 连接感知与拓扑发现

  • 自动构建服务调用拓扑(无需Service Mesh)
  • 自动识别MySQL/Redis/Dubbo等协议
  • 服务依赖图实时更新
  • 端口监听状态变化即时告警
  • 连接风暴检测

📊 业务全景 + APM 探测

  • HTTP/TCP/进程/日志/JVM 五种探测
  • 每30s自动执行,出问题自动触发根因诊断
  • 10条预置诊断规则开箱即用
  • 每台服务器完整"机器画像"

🎮 GPU / 大模型集群监控

  • 11种推理框架自动发现
  • Token/s 实时速率监控
  • KV Cache 使用率追踪
  • ECC错误 / XID致命错误 / GPU卡死检测

📡 23种采集器覆盖全栈

  • 系统级 / JVM深度 / 中间件 / 数据库
  • 容器全景 / K8s / 网络硬件SNMP
  • 硬件健康SMART / 日志采集 / 异常深度诊断
  • 支持CentOS6 / ARM / x86
四层根因分析引擎 + 事务性自愈执行

🔍 四层根因分析(为什么能准确)

L1 规则库匹配 — 200+预置规则,覆盖80%场景,<1秒响应
L2 拓扑传播分析 — 基于CMDB+TCP连接图,追踪故障传播,3~5秒
L3 因果推理引擎 — Granger因果检验+时序关联,识别多步因果链,10~30秒
L4 语义推断(LLM) — 结合历史案例库+知识图谱,跨系统复杂故障,30~60秒

🔄 事务性自愈执行保障

  • 风险评估矩阵:低风险自动执行,中风险单人审批,高风险双人审批
  • 执行前快照:记录当前状态,确保可回滚
  • 超时控制:每个操作有独立超时,防止卡死
  • 效果验证:修复后60秒内自动验证指标是否恢复
  • 失败回滚:验证未通过自动还原,推送升级通知
  • 经验写入:成功案例自动写入知识库,下次更快
核心指标对比:传统运维 vs 安管家 V5.0
指标传统运维(人工)安管家 V5.0提升幅度
告警降噪率~0%(全量推送)99.5%10000条→50条
故障定位时间 MTTD15~30 分钟< 1 分钟15~30倍
故障修复时间 MTTR30~120 分钟3~5 分钟10~20倍
自动修复成功率0%85%突破性
单人运维节点上限50~100 台500~1000+ 台10倍+
夜间告警唤醒次数20~50 次/月< 2 次/月10~25倍
容量预测提前量无(触发才知道)5~7 天主动预防
哪些场景完全自动?哪些需要审批?

✓ 完全自动执行(低风险)

  • 磁盘使用超阈值 → 自动清理过期日志
  • 数据库连接池满 → 自动关闭空闲连接
  • 交换机宕机 → 自动关联下游告警,只推1条
  • 进程崩溃 → 自动重启并验证服务可达
  • 缓存内存溢出 → 自动flush

⚠ 需要人工审批(中/高风险)

  • 核心服务重启(业务影响 > 30秒)
  • 数据库操作(结构变更、批量delete)
  • 生产环境配置变更
  • 批量资产操作(影响 > 10台)
  • 系统判断置信度低于80%的修复
📦 部署与交付
🐳
Docker Compose 一键部署
docker-compose up -d
5分钟完成部署
📦
完整离线私有化部署包
内网无互联网也能跑
数据永远在自己手里
满足等保2.0要求
🔧
Agent 零配置自动发现
一行命令安装Agent
自动发现所有进程和中间件
无需人工配置