Agent 运行态运维

CoAgent Architecture

分层架构 · 技术选型可解释 · 异步可验证处置闭环 · Basic → Ultra 演进

统一处置流水线 事件接入 场景路由 处置手册+工具 大模型根因推理 把握度评分 分级处置 · 审计留痕
技术栈 Python 3.11+ FastAPI · Uvicorn Pydantic v2 httpx async Jinja2 · HTMX SSE SQLite OpenAI-compat LLM
Async-first LLM / 外部 I/O 走 asyncio,SSE 时间线不断流
Config-driven 处置手册 JSON 单一真相源,改场景无需改代码
Verifiable 把握度评分独立于 LLM 自报,公式可追问可审计
Graceful degrade L0–L3 分层降级:工具 → LLM → 通道 → 整链超时兜底
表现层 · Presentation
管理台
三 Tab · SSE 时间线 · Ultra 面板 · 版本化静态资源
Jinja2HTMXSSE client
API Gateway
/events · /admin/* · /agents/* · /demo · /ultra
FastAPIPydanticmultipart
编排层 · Orchestration
Orchestrator
10min 幂等 · 链超时 30s · 全链路 audit · L0–L3 降级
asyncio.wait_forsse_manager
领域层 · 处置流水线
场景路由
(type, symptom) → playbook
router.py
Playbook 引擎
JSON SSoT · mock 工具 ×3 · 3s 超时
engine.py
ReAct 诊断
按需调工具 · max 8 步 · 失败回退 legacy
DiagnosticAgent
LLM Client
根因推理 · LLMOutput 契约 · 重试 ×1
httpxModelRouter
把握度评分
D/P/C 三因子 · ≥80🟢 · 60–79🟡 · <60🔴
scorer.pyDEMO clamp
领域层 · 增强 & 通道
Ultra 能力
知识图谱 · 相似事故 · What-if · Team-plan
ultra/
协同通道
IM 卡片(P1)· channel_sync 占位
feishu_im.py
基础设施 · Infrastructure
SSE 审计流
pub/sub · 实时推送 · 只读 replay
sse.py
SQLite
incidents · feedback · agent_stats
db.py
配置中心
.env · pydantic-settings · 超时预算
config.py
数据层 · Data (JSON SSoT)
ops_playbooks.json · scenarios/s1|s2|s3 · agents.json · calibration/
超时预算:Tool 3s · LLM 15s · 链 30s · 飞书 5s  |  降级:L0 禁止静态冒充 · L1 工具降级 mock · L2 通道跳过 · L3 整链 timeout 留痕

悬停节点高亮关联链路 · 默认显示主路径 · Basic 已实现 · Ultra 增量演进 · IM 通道 P1

S1 限流 429 · 87 🟢 可执行
S2 空检索 · 72 🟡 需确认
S3 超预算 · 58 🔴 需升级
三场景共用流水线 · 模拟 ~3ms / 真大模型 ~8–15s

事件接入

Agent 运行事件上报 · 或管理台触发 S1/S2/S3 演示

幂等检查

10 分钟内重复事件不重复推理 · 避免重复处置

场景路由

运行失败 → S1 · 质量异常 → S2 · 成本失控 → S3

处置手册 + 工具

拉取指标、配置与手册规则 · 形成诊断上下文

根因推理

影响判断 · 根因假设 · 处置步骤 · 可验证证据链

把握度评分

数据 · 手册 · 推理三因子 · 非大模型自报置信度

分级处置 · 审计留痕

管理台决策 · 实时时间线 · 回放复盘 · 反馈飞轮

87

🟢 可执行

S1 限流 · ≥80 · 敢重试 · 管理台一键重试

72

🟡 需确认

S2 空检索 · 60–79 · 禁止盲重试

58

🔴 需升级

S3 超预算 · <60 · @负责人止血

人工把关 · 飞轮

评分驱动处置权限 · 工作台模拟重试 · 审计 Tab 反馈迭代