评估(Evaluation)一直被誉为大模型应用落地过程中的最高门槛。没有可信的基准测试,优化 Prompt 或调整微调参数就如同蒙眼狂奔。Anthropic 团队近期公开了其内部用于打磨顶级 Skill 的核心武器库:通过自动化评估设计与爬山算法(Hill Climbing),让大模型自己为自己设计考卷并完成优化迭代。
两大核心指令的机制解剖
1. build-eval(构建评估集):不再依赖工程师手工编写几十个边缘 Case。该模块根据真实业务场景与失败日志,自动化合成包含正例、反例、对抗性攻击样本的全面测试集,并定义严格的多维度打分函数。
2. hillclimb(爬山优化器):每次迭代只对 Prompt 进行单一变量微调。运行测试集后,仅当综合表现提升且在留出验证集(Holdout Set)上没有出现性能衰退时,才采纳该改动。这一机制彻底杜绝了模型「看似在测试集拿了满分,实际却发生严重过拟合」的欺骗性陷阱。
实战落地成果与启发
官方公布的真实客服支撑案例显示:经过 14 轮自动化爬山迭代后,系统的端到端准确率从初始的 66% 攀升至 88%,且通过自动化精简冗余指令,单次调用 Token 消耗与推理成本缩减至原来的五分之一。
一手溯源与权威索引
本文方法论与工程细节深度对账自:
- Anthropic 官方工程博客:Anthropic: Automated Eval Design & Hill Climbing
- 开发者实战代码库:Claude API Skills: Eval Harness
- 评估理论白皮书:Evaluating Frontier AI Safety & Alignment




No comments yet