一本书说自己"可检验"是很便宜的。真正的检验要求作者先做三件不太舒服的事:把主张写到能被具体数据推翻的精度;写清什么结果算自己错了;然后承诺定期回来对账。
这一章做这三件事。
它也是全书最容易过期的一章——如果一切顺利,五年之后它应该有一半被划掉,标注上"已证伪"或"已成立"。一本理论书最好的结局不是被反复引用,是被数据结算。
每条包含五项:精确表述、它在证伪什么、怎么测、什么结果算证伪、当前置信。
表述:在同一判断点上,事实档为 P-4 的服务,其单次判断价格的中位数至少是事实档 P-3 的 5 倍。
它在证伪什么:全书的核心命题——判断的价格首先是责任的价格(第四章)。如果责任转移不带来显著溢价,那么价格就是由能力而非责任决定的,第四章整章需要重写。
怎么测:合同与公开报价抽样。抽样框、纳入排除标准、编码规则见配套的 J 数据采集包。档位按事实编码不按宣称,用三问定档。样本量下限:每档不少于 15 条,覆盖不少于 3 个行业。价格需折算为可比的单次价,无法折算的样本剔除而非估计。
什么结果算证伪:在样本充足的前提下,两档单次价中位数之比小于 2 倍。落在 2 到 5 倍之间为灰区,需扩大样本或检查是否把 L3 陷阱误编为 P-3。
当前置信:〔推断〕。依据是若干次真实谈判中的观察与公开报价的粗略比较,样本远不足以支撑。这是本书最需要数据的一条。
表述:承担验收职责(定义合格标准/签字确认他人或系统的输出/对结果被追责)的岗位,其薪资中位数显著高于同职级、同城市、不承担验收职责的岗位,且这一差距在三年窗口内扩大。
它在证伪什么:第七章的分配结论——验收位是升值区。
怎么测:岗位薪资面板。用招聘数据与内部薪资表构建"验收密集度"指数(三问打分),控制职级与城市后比较。每组样本不少于 20 条。
什么结果算证伪:控制职级与城市后,比值小于等于 1.0;或三年内差距缩小。
当前置信:〔推断〕。
表述:在不披露三指标(判断一致率、复现率、边界失效率)的服务品类中,价格的纵向趋势向 P-2 区间收敛。
它在证伪什么:第二章的柠檬化推论与第四章"没有评测就没有溢价"。
怎么测:选定若干品类,纵向追踪其公开报价的中位数与分布,同时记录该品类是否出现三指标披露。比较披露组与未披露组的价格轨迹。
什么结果算证伪:未披露三指标的品类,其价格中位数长期稳定在 P-3 区间及以上而不下滑。
当前置信:〔推断〕。
表述:至二〇三一年,市场上出现以"AI 判断误判导致的直接损失"为承保标的的商业保险产品,且可公开查询。
它在证伪什么:第四章 P-5 档的可实现性,第八章关于保险前置条件的分析。
怎么测:保险产品目录检索与监管备案查询。判据从宽——只要出现一款以此为主要标的、面向市场销售的产品即算成立,不要求规模。
什么结果算证伪:至二〇三一年仍无此类产品。
当前置信:〔推断〕。若证伪,第四章的阶梯顶端塌陷,"担责是最厚利润区"这一战略判断需要撤回。
表述:至二〇三一年,出现以判断服务质量认证为主营业务的独立第三方机构,且其认证结果被至少一个采购方在公开的采购要求中引用。
它在证伪什么:第八章关于信任品市场两根柱子的判断。
怎么测:市场观察与采购文件检索。
什么结果算证伪:至二〇三一年无此类机构,或有机构但无任何采购方引用其结论(后者说明认证未被市场承认,与不存在等价)。
当前置信:〔推断〕。
表述:依赖通用推理的 AI 产品,其毛利率随基础模型代际更新而下降;依赖判例料与偏好料的产品,毛利率不随之下降。
它在证伪什么:第五章的折旧规则,以及由此推出的估值逻辑。
怎么测:事件研究。以基础模型的重大发布为事件窗,比较两类公司在事件前后的毛利变化。样本需要可获得的财务数据,因此优先选择上市公司或有公开披露的企业。
什么结果算证伪:两类公司的毛利变化无显著差异;或依赖判例料的一类同样显著下滑。
当前置信:〔需确认〕——这是七条里证据最弱的一条,因为分类本身需要对每家公司的资产结构做判断,而这个判断可能引入偏误。方法上需要先解决分类的可复现性。
表述:至二〇三一年,出现独立的第三方判断评测与审计服务,且其收费与被评测服务的责任档位正相关——即为 P-4 及以上服务做的评测,收费显著高于为 P-2 服务做的评测。
它在证伪什么:本书最基础的一个假设——验收可以被定价。第五章把评测集列为四大资产科目之一,第八章把它称为最大的制度缺口,两者都建立在"这东西迟早值钱"之上。如果五年后评测服务始终无法作为独立生意存在,那么验收的价值可能根本无法从服务本身剥离出来单独交易,第五章的资产科目要删掉一项,第八章的整个制度路径要重画。
它从哪来:一个现实观察。真实交易中验收条款普遍空白(第二章、第九章);评测集有明确价值、明确买家、清楚的技术方法,却没有市场(第八章)。这个反常本身要么说明市场没成熟,要么说明我的假设错了。J7 就是用来分辨这两者的。
怎么测:市场观察 + 定价结构分析。成立需同时满足:存在以此为主营的机构、有付费客户、且收费与档位正相关。
什么结果算证伪:至二〇三一年无此类服务;或有服务但收费与档位无关(说明它被当作一次性的技术检测在卖,而不是责任定价的基础设施)。
当前置信:〔推断〕,且是七条里我个人主观概率最低的一条——因为它同时依赖需求侧的认知觉醒与供给侧的冷启动。正因为最可能错,它最值得写出来。
上面七条是零件的检验。下面三条是地基的检验——任何一条成立,本书不是需要修补,是需要推倒。
死法一 · 责任被技术手段完全解决。
如果归因问题被真正解决——出现某种机制能够自动、可验证、无争议地把一次判断失误的责任分配到各参与方——那么"担责不可复制"就不成立了。担责会变成一件可以被复制、被自动执行、边际成本趋零的事,于是它和判断本身一样廉价。E2 塌了,全书跟着塌。
我认为短期内不会发生,因为归因的难点不在技术在语义("这次损失有多少是因为你的模型"这个问题在很多情况下没有客观答案)。但这是一条真实的地基风险,不是修辞上的谦虚。
死法二 · J1 长期被证伪。
如果多轮、跨行业、样本充足的测量都显示 P-4 与 P-3 的价差始终不足两倍,那么"责任决定价格"就只是一句修辞。责任阶梯还可以作为风险识别工具存在(L3 陷阱仍然有用),但它不再是一个定价理论。本书降级为一份采购风险清单。
死法三 · 市场长期停在 P-1 与 P-2,且认证与保险始终不出现。
即 J3、J4、J5 全部落空。这说明 E2 虽然在逻辑上成立,却没有市场化的通道——担责确实不可复制,但市场就是不为它定价,宁可让责任永远悬空。那么本书退化为一份定价备忘录:观察都对,但没有一条能变成交易。
我认为三条同时发生的概率不高,但它们必须被写出来。可证伪是理论对自己的最低尊重——一本教人给判断定价的书,如果不肯给自己的正确性标一个置信度,它就没有资格教这件事。
划清边界与给出主张同样重要。以下问题本书不适用,误用会得到错误结论。
无失误后果的产出。 纯内容生成、创意发散、陪伴类交互——这些没有"做错了有人担责"的判断点,价值来自注意力而非判断,定价逻辑归注意力经济学。第一章的担责闸门就是为了把这类场景挡在门外。
基础模型层的定价。 算力、参数、推理成本的定价属于算力经济学,与本书的责任定价是两套逻辑。本书处理的是模型之上的那一层。
金融资产定价。 判断资产虽然可以估值(第五章),但它不是可交易的金融资产,本书没有给出贴现率、风险溢价、流动性折价的处理。谁要拿第五章去做一级市场估值,需要自己补上这些。
劳动经济学的残余问题。 第七章讨论的是分配结构的方向,不是就业总量预测。本书不预测会消失多少岗位,因为那需要宏观模型,而我没有。
伦理规范的正当性论证。 责任应当如何分配,是《智能体的社会科学》的题目。本书只处理责任如何被定价。价格不能论证正当性,正当性也不能替代价格。
接口 密度(判断点/L/验证时点=原材料)· 认知工程(三指标=质量计价、抗吞噬=折旧)· 社会科学(A2=E2 地基、责任缺口=P-4/P-5 价差成因)· AMS(F05/F06/F30/F31=企业应用层)· 蓝皮书(J1–J7 年度跟踪)
作者承诺每年对 J1–J7 做一次公开对账,与本书同址发布。对账格式固定为四栏:
| 主张 | 本年新增证据 | 置信变化 | 处置 |
|---|
处置只有四种取值:维持、修正(调整表述或阈值,需说明理由)、证伪、撤回。
三条纪律:
对账的落地形态是证据引擎(证据库与对账表):那里放着八份一手记录的证据索引、2026 年的首批基线读数、九条主张的状态表,以及一份《判断交易记录》采集协议——主张要能被检验,先得有地方放证据。
读者可以参与的三种方式:用配套的 J 数据采集包采集并回流数据;提交一次用本书方法算过的真实复盘(算对算错都有价值,算错的更有);直接指出某条主张的表述漏洞。
招题一 · 责任溢价的首次实测(J1)。
问题:同一判断点上,"给建议"与"做决定"两类服务的价差是多少?
所需数据:同领域两类 AI 服务合同或正式报价各 30 份以上,跨 3 个行业。
难点:合同不公开。可行路径是与采购方合作做脱敏抽样,或从公开招标文件入手。
合作方式:数据由采集方自持,本书方只做方法与编码规则的贡献,结果共同署名。
招题二 · 验收工资溢价面板(J2)。
问题:验收职责是否带来可观测的薪资溢价?
所需数据:招聘平台岗位描述与薪资区间,三年窗口。
难点:验收密集度的编码可复现性。需要先做编码者一致性检验(同一批样本由两人独立编码,不一致率超过三成则修订问法)。
合作方式:适合有数据获取能力的研究团队独立完成,本书方提供编码协议。
招题三 · 判断资产折旧的事件研究(J6)。
问题:基础模型的重大更新,是否对两类 AI 公司的毛利产生不同影响?
所需数据:有公开财务披露的 AI 公司面板,基础模型发布时间序列。
难点:公司分类的客观性。建议用可公开验证的代理变量(如是否自持行业数据集、是否有专有标注体系)而非主观判断。
招题四 · 组织内责任阶梯的实证(第四章新增内容)。
问题:内部担责机制的成熟度,是否预测 AI 采购的实际使用率与续约率?
所需数据:若干企业的内部权责设计 + 采购后 12 个月的使用数据与续约结果。
这条题目最贴近实践,也最难拿到数据,但一旦做出来,它同时检验第四章的新增部分与"L3 陷阱导致钱白花"这个判断。
招题五 · 评测集市场的冷启动实验(J7)。
问题:如果有人真的开一家评测机构,卡在哪一步?
方法:这不是观察性研究,是一次真实的尝试——选定一个验证时点短的垂直领域,建立评测集,向该领域的服务商提供付费评测,记录每一步的阻力。
价值:无论成败都能回答第八章的四条原因哪一条是真正的瓶颈。失败的记录与成功的记录同样有用。
五个招题的共同点:它们都不需要先相信这本书。 任何一个做出来的结果,都可能是推翻它的那一个。