主页 项目 博客 联系
主页 项目 Agent 运行时评估平台
Agent 工程 · Open Source

Agent 运行时评估平台

AI Agent 运行时全维度质量评估平台:6 维评分(规划、决策、工具使用、记忆、重规划、检索),LLM-as-Judge、多模型共识、增量评估。

★ 0 StarsPythonAgent 工程Open Source
github · Agent-Runtime-Evaluation-Platform
$ python -m agent_eval run --suite daily ✓ Agent 运行时评估平台 ready · status: ok

作品介绍

不止看结果,还看过程。SDK 采集 Agent 运行轨迹,LLM-as-Judge 从 6 个维度 20 项指标打分,多模型共识减少偏见,支持增量评估。

核心特性

6 维 20 项指标

规划、决策、工具使用、记忆、重规划、检索全维度覆盖。

LLM-as-Judge

大模型裁判 + 多模型共识,评分更稳定客观。

轨迹 SDK 采集

运行时轨迹自动上报,评估与执行解耦。

增量评估

支持对迭代版本增量回归,守护每次发布。

界面 / 运行示意

线框示意,展示关键交互与数据形态;完整体验请运行仓库。

前往仓库 ↗
demo · 数据示意
规划质量88PASS
工具使用92PASS
记忆一致性81PASS
检索命中79WATCH
重规划效率85PASS
决策合理性90PASS
quickstart · 快速开始
$ python -m agent_eval run --suite daily
> README.md · docs/ · examples/
✓ open source · MIT friendly
已复制到剪贴板