为 Agent 建立或改进评估体系时使用——设计评估指标(Pass@k/Pass^k/成本)、搭建可重复运行的评估环境、选择确定性验证器或 LLM-as-a-Judge 及各自适用边界、编写 Rubric、做失败归因与回归任务、评估驱动的模型选型、判断统计显著性、建设可观测性与内部评估基础设施(消融、AB 测试、特性开
复制下面这句话,粘贴给 Claude Code、Codex、Cursor 等 AI 编程工具,它会读取安装说明并在你确认后完成安装。
请阅读 https://ai.atlankj.com/install/asset/gh-agent-evaluation-5e4438f753f1 ,按照其中的说明把「agent-evaluation」安装到你(当前 AI 工具)中。执行前先告诉我将运行的命令和写入的位置,等我确认。
查看 AI 将读取的安装说明正在读取 GitHub 原文…
内容来自 GitHub 原始文件,由原作者维护。在 GitHub 查看
initialization_actions 即重置脚本);真实性(变化符合业务逻辑)与可控性(每次回到同一起点)兼得。reward_basis)。chapter7/tau2-bench-eval/ — τ²-bench telecom 五任务双控环境评估:环境 reset、轨迹保存、二元奖励与失败任务(错选线路漏做充值)分析chapter7/android-world/ — T3A 运行记录、失败归因笔记,以及 diagnose→hypothesize→experiment→decide→iterate 的五阶段改进闭环chapter7/public-health-reporting-eval/ — 合成数据上的确定性六点评分:工具选择、参数、答案、证据行、无依据声明处罚chapter7/agent-cost-analysis/ — 八轮退款任务全链路成本拆解,KV-cache 友好与上下文压缩的 2×2 A/B 量化chapter7/model-benchmark/ — 多维度模型基准 campaign:吞吐/TTFT/尾延迟、168 小时可用性、限流爬坡、同模型不同供应商对照chapter7/model-action-threshold/ — 固定 Coding Harness 下测量不同模型的行动阈值(首次修改前的工具调用与文件阅读)chapter7/elo-leaderboard/ — 从 Chatbot Arena 真实投票实现 Elo/Bradley-Terry 配对排名与历史快照book/chapter7.md「评估指标:成功的定义」book/chapter7.md「评估环境」book/chapter7.md「自动化评估方法」book/chapter7.md「评估驱动的模型选型」book/chapter7.md「评估结果的统计显著性」book/chapter7.md「Agent 的可观测性」book/chapter7.md「从 Benchmark 报告到系统改进」book/chapter7.md「从外部评估到内部评估:生产级 Agent 的评估基础设施」