我们的评估方法
Agent GPA:在代理的评分超过它所取代的流程之前,我们不会上线
这听起来理所当然,却几乎没人这么做。常见的顺序是:构建代理、演示代理、上线,然后六周后发现团队悄悄回去用电子表格了。先评分正是为了避免这种情况,也是我们有时会劝客户不要做的原因。
我们先给人工流程打分
在编写任何代理之前,我们从四个维度衡量人工流程。不是为了论证该自动化,而是为了弄清楚到底该不该。
单案耗时
一个人处理一个任务实例需要多久——覆盖足够多的案例,以便如实反映最慢的情况,而不是演示时的情况。
错误率
当前人工流程出错的频率。这个数字几乎总是比所有人预想的更糟,也是评分带来的最有价值的一项结果。
纠错成本
每个错误在下游造成的成本——返工、资深人员复核时间、客户来电。花四分钟发现、却要一小时收拾的错误,并不是同一类错误。
上报质量
流程无法处理的案例会怎样。干净地移交给人是好结果;悄无声息地给出错误答案则不是。
然后用同一批案例为代理的每个版本打分
同一组案例、同样四个指标、一个版本接一个版本。这就是全部要义,而纪律在于使用同一批案例,而不是代理恰好擅长的那些。
只有当代理在该工作流真正重要的指标上超过基线时才会上线,不会更早。有时是第二版,有时是第九版,偶尔永远达不到——那是一个结论,而不是失败。
有时答案就是不要做
如果一个流程已经有 99% 的准确率、只需四分钟,代理并不是收益所在。我们宁愿在界定范围时就说,而不是十一周后才说。
基线通常比所有人以为的更糟
人工三方发票匹配并不能做到 100%。一旦真正去测量,代理需要跨过的门槛才变得诚实。
受监管的客户需要书面记录
在国家银行或 MAS 的审视下,“供应商说效果不错”不是答案。一份有评分的评估才是风险部门会索取的材料。
关于 Agent GPA 的问题
Agent GPA 是我们判断一个 AI 代理是否值得上线的方法。在构建任何代理之前,我们先从四个维度给现有人工流程打分:单案耗时、错误率、纠错成本与上报质量。这构成基线。随后代理的每个版本都用同一批案例评分,直到超过它将要取代的流程才会上线。名字是我们取的;做法则是把常规的评估纪律放在比多数供应商更早的阶段。
因为没有基线,“代理准确率 92%”毫无意义。如果你的团队是 80%,92% 很出色;如果是 99%,就无法接受。先给人工流程打分也是最常终止一个项目的步骤——在界定范围时终止只花掉一次范围讨论,上线后终止则要花掉一个季度。
频率高到我们认为这是这套方法的特性,而不是缺陷。如果一个流程已经 99% 准确、只需四分钟,代理并不是收益所在——这笔钱花在别处更好。当喂给流程的数据本身有问题时同样如此:把代理接到糟糕的源数据上,只会更快地给出更自信的错误答案。
需要,而且这通常正是他们发问的原因。若你受马来西亚国家银行或 MAS 监管,“供应商说效果不错”不是答案。带有书面基线、逐版本记录、以及具名负责签核的评分评估,才是风险部门会索取的材料。我们把它作为常规产出,而不是应要求才提供。
由设计该系统的 Claude Certified Architect 签核。不是转述数字的交付经理,也不是上线后才发现的客户。您在我们动工前批准基线,在任何东西接触客户或账簿前批准评分。
免费咨询
Tell us the process you want scored
We will measure what it costs you today before proposing anything. If the numbers say an agent is not the answer, that is what we will tell you.
