项目背景: 针对高并发集群监控噪音大(告警风暴)、AI 决策不透明导致误操作风险以及跨环境自愈逻辑断层的痛点,构建了一套集“感知-审计-决策-执行”为一体的端云协同 AIOps 闭环体系。
核心职责与实现:
- 端云协同与感知降维: 利用 Ray 构建边缘感知 Agent,运行 PyTorch 动态基线模型,在本地实时过滤 90% 的周期性监控噪音;仅将高价值异常事件通过 Kafka (KRaft) 投递至中枢,大幅降低云端 LLM 推理成本。
- 基于 OpenClaw 的智能调度: 深度定制 OpenClaw 作为自愈中枢,通过 RAG (向量检索) 挂载内部运维知识库,实现“现场取证+经验匹配+云端推理”的根因分析 (RCA) 链路,将平均修复时间 (MTTR) 降低了 70%。
- 硬核审计准入机制 (Admission Control): 二次开发 OpenClaw 执行流,在指令下发前强行插入 Audit Hook。由 Ray Actor 审计 Agent 对自愈提案进行“安全、状态、频率”三维度准入校验,从架构层面彻底杜绝 AI 幻觉引发的生产事故风险。
- 标准化执行与安全回滚: 封装 MCP (Model Context Protocol) 协议对接底层 Ansible Skill 库,实现运维动作的原子化与解耦;配合审计 Agent 的 30s 持续观测机制,实现故障恢复失败后的秒级全自动回滚 (Rollback)。
- 高性能数据总线: 搭建基于 KRaft 模式的 Kafka 集群,利用 RoCE v2 协议优化 AI 分析链路,支撑海量异构日志的高吞吐接入与零延迟传输。
- OpenClaw与Ray融合的多智能体自愈中枢: 以 Ray 分布式框架为底座深度融合 OpenClaw 调度引擎,构建了跨节点的“感知-决策-执行-审计” Agent 集群。通过 MCP 协议实现对 Ansible 等底层工具的解耦调用,并依托 Ray Actor 状态机设计了秒级故障回滚机制,针对 K8s/Docker 核心组件实现全自动闭环自愈,将 MTTR 显著降低 70%。
- 动态基线与趋势预测: 摒弃传统静态阈值,采用 PyTorch 构建非线性预测模型(结合 PromQL 滑动平均),利用自适应基线屏蔽了 90% 的周期性监控噪音,实现磁盘/内存枯竭点的提前预警。
- RAG 增强与根因分析 (RCA): 接入 Qwen3 大模型并通过 OpenClaw 挂载 RAG 插件,实时匹配内部运维知识库。通过 Prompt Engineering 将故障上下文与自愈执行状态注入诊断链路,自动生成具备修复建议与根因分析的深度报告。
- 全栈可视化观测: 构建 Grafana + Loki 的统一观测平台,实现业务日志与监控指标的同屏钻取,并在 Grafana 中实现 AI 预测曲线与实际物理监控数据的实时可视化对比,消除监控盲区。
