首页
← 所有文章

How to Evaluate AI Agents in Practice

从真实决策出发,判断评估是否值得,以及怎样投入。

AI产品

评估首先是一项资源配置决策。开始构建 benchmark 前,需要确认项目目标、评估结果可以改变的行动,以及获取这些证据的成本。

从真实工作流开始

业务数据是构建评估的起点,但有数据并不自动产生持续改进。每次标注都包含一次业务判断,这些判断需要被保存、解释和检验。

模型效果与交付之间

在公益组织的语音项目里,评估结果不错,但独立网页要求运营人员额外登录和上传。后来把能力嵌入已有流程,才减少了实际工作的摩擦。

这提醒我同时检验两件事:能力是否达到要求,使用方式是否真正帮助工作中的人。