How to Evaluate AI Agents in Practice
从真实决策出发,判断评估是否值得,以及怎样投入。
评估首先是一项资源配置决策。开始构建 benchmark 前,需要确认项目目标、评估结果可以改变的行动,以及获取这些证据的成本。
从真实工作流开始
业务数据是构建评估的起点,但有数据并不自动产生持续改进。每次标注都包含一次业务判断,这些判断需要被保存、解释和检验。
模型效果与交付之间
在公益组织的语音项目里,评估结果不错,但独立网页要求运营人员额外登录和上传。后来把能力嵌入已有流程,才减少了实际工作的摩擦。
这提醒我同时检验两件事:能力是否达到要求,使用方式是否真正帮助工作中的人。