模型有边界,判断也要为误差留位
模型不必完整复制现实才能有用;它只需在明确任务中保留关键关系,并让误差处于可承受范围。危险不是模型“错”,而是不知道它怎样错、错到哪里。
60 秒核心判断
模型不必完整复制现实才能有用;它只需在明确任务中保留关键关系,并让误差处于可承受范围。危险不是模型“错”,而是不知道它怎样错、错到哪里。
负责任的使用包含独立验证、边界说明、持续监测和人工退出权。
同一模型为什么会越界
从预算、信用评分到人工智能,模型把复杂判断变得可重复。但模型依据过去数据和人为目标建立,环境、行为与制度一变,原有关系就可能漂移。
人又容易把数字输出当作客观事实。小数点和图表给结论披上精确外衣,却不会自动消除价值选择与数据缺口。
从正名到模型治理:抽象怎样受限
《公孙龙子》的“白马非马”揭示名称层级和分类条件会改变命题。它不是现代建模理论,却提醒我们:类别如何划分,决定了哪些差异被看见。
名可以帮助辨析,也可能让人困在语言中。使用分类前必须问,它服务的是哪个问题。
培根要求用系统观察纠正心智先入之见。即使承认模型只是近似,治理问题才刚开始:谁验证它,怎样监测漂移,受影响者如何提出异议?
美国联邦储备系统 SR 26-2 把修订后的模型风险管理指引用于其监管范围内、总合并资产超过 300 亿美元的银行机构,并要求与模型风险相称的验证、监测与有效挑战。附件强调挑战者要有客观性、专业能力和足够独立性,但没有规定统一的组织结构。它不能直接当成所有企业、所有 AI 系统的普遍法律义务。
名家讨论语言分类,培根讨论经验方法,Box 与现代监管处理量化模型。它们不属于同一知识传统,但都要求检查抽象与对象的距离。
并非所有决定都需要复杂验证。风险越高、影响越广、越难申诉,验证要求才应越严格。
用同一个招聘模型做三次检查
设想一个招聘模型只从过去“成功员工”学习。第一,错误要可见:按岗位、性别和来源渠道分别报告误拒率,而不只看总准确率。第二,结论要可争议:受影响者可指出履历数据错误,并由能客观挑战开发结论的人复核。第三,使用要可退出:若连续两期误拒率越过预设边界,暂停自动筛选,退回人工流程。
三个条件并不保证模型公平,却把“发现问题—提出异议—停止暴露”变成可审查事件。天气概率模型则说明另一边界:不完整不等于无用,关键要比较有模型和无模型各自的错误基线。
反例说明“不完整”不能直接推出“无用”。应比较使用模型与不用模型各自的错误。
本文主张模型治理应让错误可见、可争议、可退出。对影响重大利益的模型,应回答谁承担误差、谁能申诉、谁有权停用;申诉和人工退出权是本文的规范性要求,不冒充 SR 26-2 的逐字规定。
好的模型不是永不出错,而是错误不会被权威外观长期隐藏。
落到行动:
- 可见:列出分组错误率、数据漂移与容许边界。
- 可争议:指定谁能纠错、复核者需要哪些材料、多久答复。
- 可退出:写明暂停阈值、备用流程和恢复条件。
出处与版本
- 《公孙龙子·白马论》(访问:2026-07-15)
- Francis Bacon, Novum Organum, Book I, Aphorisms XXXVIII–LXVIII,Joseph Devey 编,Project Gutenberg eBook #45988。文本(访问:2026-07-15)
- Board of Governors of the Federal Reserve System, SR 26-2, “Revised Guidance on Model Risk Management”,附件 §V “Model Validation and Monitoring”;“effective challenge”的客观性与足够独立性见附件定义。官方页及附件 PDF(访问:2026-07-15)