返回博客

2026.09.11

同样一句「帮我写个东西」,为什么有人做出了产品,有人被法院罚了五千美元

AI 时代真正的分层不在编程水平上。能安全使用 AI 的上限,等于你验收它产出的能力——这个量可以算,而且能解释为什么 AI 在围棋上早就超人、在法律上却还在制造事故。

aiengineeringmethodology

2023 年,一位执业三十年的纽约律师把 ChatGPT 写的诉状交了上去。里面引了六个判例,六个全是编的。他不是没有怀疑过——他反复问模型「这些案子是真的吗」,模型每次都说是真的。法官罚了五千美元,理由写得很不客气。

同一年,无数完全不会编程的人用同一类工具做出了能跑的小工具,自己天天在用。

两边都是纯许愿:说一句话,拿一个东西,不看内部。区别在哪?

一个除法

你能安全使用 AI 的上限,等于你的验收带宽。

验收带宽 = 判据强度 ÷ 单次验收成本

判据(英文常叫 oracle,判定对错的那个东西)指的是:你手上有没有一个独立于 AI 的办法,判断它这次给的东西到底成不成立。单次验收成本指的是用这个办法跑一遍要花多少时间、钱、专业知识。

那位律师的判据强度其实极高——判例存不存在,这是硬事实,不存在争议。他翻车的地方在成本项:他以为验收成本是零(问模型一句),实际成本是三十秒的数据库检索。他不知道自己需要去查,于是那个除法的分母被他填成了零,算出来一个无穷大的带宽,然后撞墙。

那些做小工具的人反过来。判据强度看着很弱(就是「能跑、结果对」),但验收成本真的接近零——他自己就是完美判据,打开一看就知道对不对。带宽照样够用。

所以这两拨人根本没在同一个赛道上竞争。

领域天梯:AI 渗透得快不快,跟这个领域难不难无关

把上面那个除法推一步,会得到一个我觉得比公式本身更有用的结论:

AI 在一个领域的推进速度,跟这个领域的智力难度基本无关,跟它的判据有多便宜成正比。

按判据成本从便宜到贵排一下:

围棋——胜负就是判据,成本几乎为零,一台机器一秒能自己跟自己下几千盘。所以这是第一个被彻底拿下的领域,十年前的事了。

代码——编译器、类型检查、单元测试,全是不要钱的判据,机器自己就能跑。所以现在最疯的是这块。注意这里的因果:代码被 AI 吃得深,不是因为写代码简单,是因为「这段代码对不对」这个问题有一个七毛钱都不要的自动裁判。

形式化数学——Lean 这类证明检查器是绝对可靠的判据,机器验证,不接受花言巧语。OpenAI 那些数学成果出在这个方向上,不是巧合。你可以让模型吐一百个候选证明,检查器逐个过,错的当场毙掉。值钱的从来不是那一百个候选,是那个检查器。

医疗、法律、投资、公司战略——判据昂贵,而且延迟到达。一个错误的诊断、一份有坑的合同、一个亏钱的策略,反馈要几周到几年才回来。这类领域的 AI 事故有个共同特征:出事的时候没有任何声音。编译器会红,法官要六个月后才红。

审美——判据免费,但不可外包。只有你自己是那个裁判,谁也替不了。所以这块 AI 很能帮忙,但永远替不掉那个点头的人。

这张梯子解释了一件很多人觉得反直觉的事:AI 在「难」的领域(数学证明)进展飞快,在「简单」的领域(写一封得体的商务邮件)反而拉胯。因为数学有检查器,得体没有。

一个我认为最值得引用的数字,以及它真正在说什么

METR 在 2025 年做了一个随机对照实验:16 个有经验的开源开发者,246 个真实 issue,随机分配「允许用 AI」和「不许用 AI」,在他们自己熟悉的仓库上干活。

结果是用 AI 的那组慢了 19%

这个数字被转发了无数次,大多数转发的人停在「看吧 AI 没用」。我觉得真正的信息在另外两个数字上:

  • 实验前,这些开发者预期 AI 会让他们快 24%
  • 实验后,亲身经历了变慢,他们仍然认为自己快了 20%

事前错四十多个百分点,事后错四十个百分点。做完了都不知道自己慢了。

为什么偏偏是老手在自己的仓库上变慢?我的解释是:慢掉的那部分正好就是验收。 这些人在自己维护了多年的代码库里,验收标准高得离谱——风格、边界情况、跟既有抽象的一致性、会不会给未来埋坑。AI 生成那部分确实快到不要钱,但生成完他们得逐行读、逐处改,读改的时间超过了自己写。

换句话说,这个实验测的根本不是「AI 行不行」,是当验收成本高到一定程度,生成免费带来的收益会被吃干净

顺手说一句怎么拆这类数字:METR 自己在文章里主动写了这个实验的适用边界——开发者用 Cursor 的时间只有几十小时,可能没过学习曲线;样本是愿意参加实验的人,本身有偏;实验测的是单人单 issue,不适用于「一次采样上千条轨迹」的场景。原文把这些全列出来了。那些拿这个数字当「AI 无用」铁证转发的帖子,一条都没提。

新手确实会赢,但归因搞错了

有个流行说法:完全不懂技术的人反而做得更好,因为他不知道什么叫「做不到」,所以敢提离谱的要求。

我觉得这个归因是错的。

「不受常识限制」这个优势,在 AI 时代已经被抵消掉了——AI 本身就是常规知识最完整的载体。你问它「能不能这样做」,它会把行业里的常规边界原样告诉你。新手拿到的答案跟专家拿到的是同一个答案。更糟的是,当模型说「这做不了」,专家知道那可能只是模型在保守,新手只能信。

专家的诅咒被 AI 继承了,而新手没拿到解药。

但新手确实在大量任务上赢,真实原因是另一个:那批任务的验收门槛恰好是零。 自用的小工具、一次性脚本、把一坨 Excel 变个形状——判据就是「我打开看一眼,对了」。在这些任务上,需求方本人就是完美判据,验收成本趋近于零,带宽无限。

而专家在这类任务上反而会亏:他会不由自主地想架构、想扩展性、想「三个月后要加功能怎么办」,把一个五分钟的活做成半天。这不是他笨,是他的肌肉记忆来自那些验收门槛很高的场景,用错地方了。

关键在于,这类任务的数量极其巨大。世界上绝大多数「我想要个东西」都属于这一类。所以「不懂技术的人靠 AI 做出了东西」这个现象会一直大量发生,它是真的,只是原因跟大家说的不一样。

判据断裂的那条线

那条线在哪?看这几个问题什么时候开始出现:

  • 这东西在 1000 个人同时用的时候还对吗
  • 这个数值精度够吗
  • 这段代码会不会哪天把数据库删了
  • 这个结论在换一批数据之后还成立吗

一旦验收需要回答这类问题,「打开看一眼」就失效了。新手在这条线之后的状态不是「做得慢」——

他不知道自己已经错了,而且会一直不知道,直到某个很贵的时刻。

这跟做得慢是两件性质完全不同的事。做得慢你知道自己在慢。判据断裂之后,你的自我感觉跟之前一模一样,甚至更好,因为 AI 从不犹豫。上面那个 METR 的数字已经说明了:连有经验的工程师都会把「慢了 19%」感知成「快了 20%」。感知这个仪器,本身就是坏的。

我自己在这条线上摔的三跤

我业余在做预测市场的量化,用 AI 生成策略、跑回测、写分析。这个场景的特点是判据极贵且延迟到达——一个假的策略从"回测很漂亮"到"真金白银亏掉",中间隔着几个月。下面三个都是真事,前两个如果我当时判据不够硬,钱就出去了。

第一跤:模型全都停在 51%。 我让 AI 跑了 6 个模型 × 3 种序列架构去预测 5 分钟级的方向,全部停在 51–52% 准确率,一个不多一个不少。当时的本能反应是换更大的模型。

但这个形状本身就是答案:如果瓶颈在模型容量,准确率应该随容量单调爬升;十八个组合排成一条平线,说明天花板在数据里,不在模型里。该换的是信息源,不是模型。

这个判断纯粹来自领域直觉。一个只会编程的人在这里会一直换模型,而且每次都能拿到"我又试了一个新架构"的成就感。

第二跤:一个看起来 EV 为正的策略,其实是把市场已经定好的价换了层皮。 AI 筛出来的高置信度分组,账面上每笔期望收益 +0.008 到 +0.013,看着能上真钱了。

我跑了两道判据:按天做 bootstrap 重采样,95% 置信区间跨零;再跟市场自己的赔率对一遍,重合度 99%。也就是说这个"策略"预测的东西,市场早就定价完了,我只是用一个复杂模型把公开信息重新表述了一遍,然后要为此付手续费。

两次,两个不同的模型架构,一模一样的病。

第三跤:手续费口径错了 3.3 倍,差点误杀一个真策略。 这个方向反过来。我最初用的手续费公式漏了一层份额换算,在某个价格区间把成本低估了 3.3 倍。修正之后,同一批 5447 笔交易的每笔期望收益从 +1.36 分掉到 +0.56 分,日级 bootstrap 的 5% 下界从 +0.57 掉到 -0.21,过零了——结论从"有 edge"直接变成"扣掉真实成本后未证明有 edge"。

反过来的情况也发生过:另一个用错误近似算成不赚钱的策略,换成正确公式之后活了过来。口径错误不但会让你上错车,还会让你亲手毙掉对的东西。

还有一个我事后才发现的、纯编程能力永远察觉不到的坑: 那个平台的结算价用的是链上预言机,不是我拿来训练的那家交易所的数据。两个来源的方向判定只有 96.6% 一致——三万多个样本里大约一千一百个的标签是反的。模型学得再好,学的是错的东西。

这个坑跟代码质量、跟模型选型、跟工程能力,一点关系都没有。只跟"我知不知道该去查结算源是什么"有关。

这段实验的缺陷,也一并说了: 上面这些结论全部来自单一市场、单一时间段的历史重放,我没有做跨市场的复现;bootstrap 用的是按天聚合,独立样本数按市场数算而不是按交易笔数算,这个口径本身也可以被质疑;第一跤里"平线说明瓶颈在数据"这个推断,严格讲只排除了"模型容量不足"这一种解释,没排除"我的特征工程全线失效"这种。我倾向前者,但没证死。

拿到任何 AI 产出之前,先问这四句

  1. 这次的判据是什么? 说得出具体是什么东西在判对错。说不出来,你现在做的事叫赌博,不叫使用工具。
  2. 跑一次判据要多少成本? 三十秒还是三个月。如果答案是"问 AI 它说对了",那你的判据是零。
  3. 反馈会延迟多久回来? 编译器立刻红,法官六个月后红,一个假策略可能一年后才红。延迟越长,越要在动手之前把判据准备好,事后补来不及。
  4. 这个任务在我的判据断裂线的哪一侧? 在里面,放手让 AI 跑,速度是纯赚的。在外面,先去把判据搞到手,或者换个人来验。

如果你想提升自己在 AI 时代的能力上限,方向不是学更多的生成技巧,是去把某个领域的判据攥在手里——那些"什么情况下这个结论会失效"的知识。生成侧已经趋近免费了,钱和风险都堆在下游那个点头的动作上。

那位律师需要的不是更好的 prompt。他需要的是有人告诉他:判例引用这件事,有一个三十秒就能跑的判据,而且那个判据不在 ChatGPT 里。


参考:METR, Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity (2025-07);Mata v. Avianca, Inc., 678 F. Supp. 3d 443 (S.D.N.Y. 2023)。