一家公司买了一套 AI 合同审查服务,用了七个月。
续约会上,采购负责人问了一个很自然的问题:这七个月它帮我们避免了多少风险?
没有人答得上来。
法务说,它标出来的问题条款我们大部分都同意,但那些条款以前也会被人看出来;至于它漏掉的——我们不知道它漏了什么,因为没漏掉的那部分才是我们看到的。有人提议抽查一批合同人工复核一遍做对照,被否了:复核一份重要合同要两个小时,抽三十份就是六十个工时,这笔钱比一年的服务费还贵。
最后续约的理由是:大家用着觉得还行,而且不续显得倒退。
这不是一次糟糕的采购决策,这是一次典型的采购决策。它之所以典型,是因为判断这种商品有四个反常性质,每一个都推翻一条标准的市场假设。上面这一幕里,四个性质全都出场了。
经济学把商品按可验性分三类。搜索品买前就能验——一个苹果新不新鲜,看一眼摸一下就知道。经验品用后能验——一家餐馆好不好吃,吃过就有判断。信任品用后也难验——一台手术做得好不好,多数病人一辈子都不会真正知道,因为没有对照组。
判断天然是信任品。
它的可验性由一个变量决定,智能密度体系称之为验证时点:这个判断的对错,多久之后、通过什么渠道能知道?
| 验证时点 | 例子 | 接近哪类商品 |
|---|---|---|
| 秒到分钟 | 生成的代码能不能跑通 | 接近经验品 |
| 天到周 | 投放素材的点击率高不高 | 弱经验品 |
| 月到年 | 这批货选得对不对 | 重度信任品 |
| 数年或永不 | 这个战略方向对不对;那份合同的风险条款有没有用 | 不可验 |
上面那家公司的困境全在这张表里:合同审查的验证时点是"出事的时候",而没出事既可能是审查有效,也可能是本来就不会出事。没有反事实,就没有验收。
这条性质有一个直接的市场后果〔推断〕:信任品市场不装认证和保险就会柠檬化。 买方无法分辨好坏时,只愿意按平均质量付钱;高质量的供应商拿不到应有的溢价,于是退出或降质;平均质量下滑,买方进一步压价。这个下行螺旋不是道德问题,是结构宿命。经典的解法是第三方认证与责任担保——这也正是第八章要处理的题目。
普通商品的质检成本远低于生产成本。造一台发动机要几万元,检验它要几百元。
判断商品刚好倒过来。
生成一百个方案是免费的;从中挑出适合你处境的那一个,需要一位资深者的注意力——而资深者的注意力是这本书里唯一没有变便宜的东西。上面那家公司算过账:复核三十份合同要六十个工时,比一年的服务费还贵。他们没算错。
更麻烦的是,AI 越强,验收越难。这一点反直觉,但机制很清楚:早期的模型出错时错得很明显,一眼能看出来;今天的模型出错时错得非常合理——引用格式完整、逻辑通顺、术语准确,只是结论是错的。验收从"找出明显的破绽"变成了"独立地把这件事再想一遍",成本因此接近于自己做一遍。
智能密度体系有一句话说得更狠:验收是唯一随 AI 变强而变难的环节〔推断——机制清楚,但缺乏跨行业的量化证据〕。
价格的下限由此从生产成本切换到验收成本。
一个无人能验收的判断,无论生产多么便宜,它的真实成本都是无穷大——因为你无法知道它什么时候会毁掉你。
这条性质推出第三章的净价值式:V 减去验收成本,才是这笔交易真正剩下的东西。它也解释了为什么很多"看起来划算"的 AI 采购算下来是负的。
错误判断的后果,经常不落在买卖双方身上。
AI 信贷模型拒绝了一笔贷款,受损的是申请人;AI 诊断给出错误结论,受损的是病人;AI 内容审核误删了一条内容,受损的是发布者。而合同只约束签约的两方。
传统商品当然也有外部性——工厂排污、汽车尾气——但那些外部性通常是生产过程的副产品,可以通过治理生产环节来内部化。判断商品的外部性不一样:它是产品本身的功能所在。判断服务的用途就是对第三方做出处置,外部性不是副作用,是主作用。
法学上把这称为责任缺口(这个题目属于《智能体的社会科学》,本书不展开)。经济学的表述是:判断交易天然产生第三方外部性,而市场自身不会为它定价。
结论是:判断市场比一般市场更早、更必然地需要制度介入。这不是一个价值判断,是一个结构判断——即使所有参与者都完全善意、完全理性,这个外部性也不会自己消失,因为承受后果的人不在谈判桌上。
你每次使用判断服务,你的使用行为都在改进它。哪些建议被采纳、哪些被否决、否决之后人改成了什么——这些都是极有价值的信息,而它们产生于买方的消费过程。
买方的消费行为同时是卖方的生产行为。
传统商品里不存在这件事:你吃苹果不会让果园变好。判断商品里它是默认配置,通常被称作数据飞轮。
它带来一个悬而未决的产权问题:这部分增值归谁?
今天的默认答案是"全部归卖方,且写在几十页服务条款的某一段里"。这个答案有一个明显的不稳定之处:买方支付了服务费,同时无偿提供了让服务变好的生产资料,而变好之后的服务将以更高的价格卖给包括他的竞争对手在内的所有人。第八章会论证这个默认答案不可持续,第五章会先说清这份增值在账面上到底叫什么(判例料与偏好料)。
四个性质摆在一起,会推出一个很自然的预期:既然验收这么关键、这么昂贵、这么难,那么真实合同里一定会有一整套关于验收的条款——什么算合格、谁来判定、用什么指标、不合格怎么办。
真实情况是没有。
我复盘过一桩谈到报价阶段的采购:买方是一家年营收六亿的装备制造企业,卖方是一家做企业 AI 落地的服务商,首年金额三十到五十万,双方谈了行业趋势、技术路线、推进阶段、长期合作规模,价格谈得相当细。整份方案里没有任何一条写明什么算成效、谁来判断、用什么指标〔已知〕。
另一场硬件合作洽谈进行了一个半小时,从场景聊到愿景,事后复盘时发现"连样品怎么收费都没定"〔转述〕。
这不是个别的疏漏。它说明了一件比疏漏严重得多的事:
验收不仅"不可复制",在今天的市场上它甚至不被定价、不被书写。
定价谈得越细、验收越空白,说明这个市场还停留在"按投入付费",而不是"按判断付费"。
这个空白是本书识别出的最大制度缺口。它同时是三件事的来源:第八章关于评测集为何迟迟没有形成市场的分析;第十一章新增的主张 J7;以及第九章那桩真实交易的完整拆解——那一章的标题就叫"一桩真实的判断交易,以及它缺失的那一页"。
| 商品 | 买前可验? | 边际成本 | 外部性 | 使用是否生产 |
|---|---|---|---|---|
| 苹果(搜索品) | 可 | 正 | 无 | 否 |
| 餐馆(经验品) | 否 / 用后可 | 正 | 小 | 否 |
| 软件(信息品) | 部分 | 趋零 | 小 | 弱(反馈) |
| 手术(信任品) | 否 | 正 | 中 | 否 |
| 判断(本书) | 否,且用后未必可验 | 趋零 | 内生第三方 | 是(飞轮) |
把这张表读一遍就会发现:判断把四类商品各自最难处理的那一面全部集齐了。可验性最差的一面来自信任品,边际成本结构最极端的一面来自信息品,外部性最深的一面是它自己独有的,而"使用即生产"在其他四类里几乎不存在。
这就是为什么判断市场不装认证与保险就必然柠檬化——也是为什么装上之后,利润会比任何一类都厚。四个最坏的性质集于一身,意味着谁能把它们逐个制度化,谁就同时拥有了四道别人跨不过去的门槛。
反驳一:手术、法律咨询、审计——信任品市场早就存在,也运转得不错。判断有什么特别的?为什么需要一门新经济学,而不是把现成的专业服务经济学搬过来用?
这条反驳很强,我承认现成的框架能解释一大半。差别在两个地方。
第一是边际成本。外科医生做第二台手术要花和第一台一样的时间,这个约束限制了供给,也因此支撑了价格。判断的第二次交付成本接近零,这意味着供给可以瞬间放大到无限,价格无法再靠稀缺性支撑——只能靠责任支撑。传统专业服务经济学里,稀缺与责任是捆在一起的(能担责的人本来就少);在这里它们被拆开了。
第二是责任主体。医生、律师、会计师有执业资格、有强制保险、有行业惩戒、有可被吊销的东西。一个 AI 系统什么都没有,它不能被吊销执照,不能被追究,不能破产。当代理人无法承担责任时,责任不会消失,它会回流到某个具体的人身上或者悬空——第四章的 L3 陷阱处理的就是这个回流与悬空。
所以准确的说法是:本书不是要取代专业服务经济学,是要处理它的两个前提被拆掉之后剩下的问题。
反驳二:这四条性质有拼凑感。它们来自不同传统,被硬放在一起是为了让理论看起来完整。
如果它们只是并列,这条反驳成立。但它们不是并列,是有结构的:性质一决定了这是个什么市场,性质二决定了价格的下限,性质三决定了必须有制度介入,性质四决定了资产在谁手里积累。 分别对应本书的第八章、第三章、第八章与第五章。
更重要的是,四条共享同一个源头。它们都是 E2 的推论:判断可复制、验收与担责不可复制。可复制推出边际成本趋零(性质四的飞轮由此可能);不可复制推出验收昂贵(性质二)与责任无法随判断一起转移(性质三);而两者的落差正是验证时点被拉长的原因(性质一)。如果 E2 是错的,四条会一起垮,而不是垮掉其中一两条。 这种连带性正是可证伪性的表现,不是拼凑的表现。
验证时点这个概念来自智能密度体系,本书直接引用,用它给信任品的严重程度分级。
三指标(判断一致率、复现率、边界失效率)来自认知工程派,是"如何降低验收成本"这个问题的工程答案,本书在第四章把它当作定价资格的判据。
责任缺口的制度与伦理后果属于《智能体的社会科学》;本章只到"市场不会自己为外部性定价"为止,再往前一步就越界了。