Agent 工程 · Open Source
Agent 运行时评估平台
AI Agent 运行时全维度质量评估平台:6 维评分(规划、决策、工具使用、记忆、重规划、检索),LLM-as-Judge、多模型共识、增量评估。
$ python -m agent_eval run --suite daily
✓ Agent 运行时评估平台 ready · status: ok
作品介绍
不止看结果,还看过程。SDK 采集 Agent 运行轨迹,LLM-as-Judge 从 6 个维度 20 项指标打分,多模型共识减少偏见,支持增量评估。
核心特性
6 维 20 项指标
规划、决策、工具使用、记忆、重规划、检索全维度覆盖。
LLM-as-Judge
大模型裁判 + 多模型共识,评分更稳定客观。
轨迹 SDK 采集
运行时轨迹自动上报,评估与执行解耦。
增量评估
支持对迭代版本增量回归,守护每次发布。
界面 / 运行示意
线框示意,展示关键交互与数据形态;完整体验请运行仓库。
规划质量88PASS
工具使用92PASS
记忆一致性81PASS
检索命中79WATCH
重规划效率85PASS
决策合理性90PASS
$ python -m agent_eval run --suite daily
> README.md · docs/ · examples/
✓ open source · MIT friendly