把昨日的延期,写进今天的估算
复盘会上,团队记得上次晚了六周。轮到估算新项目,讨论却很快换了主语:这次接口清楚,这次负责人熟练,这次审批应当顺利。旧项目留下的是一串原因,新项目得到的是一条从开工直达交付的情节。延期没有被遗忘,只是被归入“那一次”;它没有取得约束“这一次”日期的资格。
把昨日的延期,写进今天的估算
复盘会上,团队记得上次晚了六周。轮到估算新项目,讨论却很快换了主语:这次接口清楚,这次负责人熟练,这次审批应当顺利。旧项目留下的是一串原因,新项目得到的是一条从开工直达交付的情节。延期没有被遗忘,只是被归入“那一次”;它没有取得约束“这一次”日期的资格。
这里要检验的判断很窄:人知道相似任务曾延期,却可能主要依据当前任务怎样顺利展开来预测,并把旧延期解释为外部、暂时或特例;若历史记录没有按同一口径与当前任务建立关联,记得过去也未必改变下一次报价。这是可反驳的:在范围相近、记录可比的重复任务中,若经验稳定消除过早预测,或明确连接旧经验仍不改变方向偏差,这个判断就要收窄。即使平均偏差消失,绝对误差若没有下降,也只说明报早与报晚相抵,尚未说明预测更准。
古典所说的是承诺前审察
《孙子兵法·始计》从“兵者,国之大事”起笔,以道、天、地、将、法五事和七计比较敌我,篇末说:“多算胜,少算不胜,而况于无算乎?”“庙算”置于国家存亡、战争政治与敌我变化之中,其中还有诡道、势与统帅判断。它主张行动前多方审察,却没有现代项目日志、概率分布或成本基线。把“多算”译成 reference class forecasting,会抹去文本的战争语境,也会凭空赋予它统计含义。
《路加福音》14:28—33 先写建塔者坐下计算花费,免得只立地基而无法完工;接着写君王交战前衡量兵力,否则遣使求和。两个比喻最终服务于承担门徒代价的宗教教导。这里强调承诺以前衡量是否承担得起,并没有报告人会系统低估,更没有比较预测与实际日期。
两部原典都把“先算”放在重大承诺之前,分歧也很清楚:《始计》关心敌我条件与国家战争,《路加福音》指向门徒身份的代价。它们提供规范问题——为何没有先审察——却回答不了经验问题:一个人明明拥有旧延期资料,为何下一次仍没有用上。
五项研究里,记得过去与用上过去并非一回事
Kahneman 与 Tversky 1979 年的 “Intuitive Prediction: Biases and Corrective Procedures” 收于 Makridakis 与 Wheelwright 主编的 Forecasting,即 TIMS Studies in Management Science 第 12 卷,页 313—327。此文既非同年 Econometrica 的 Prospect Theory,题录也不同于所谓 Management Science 12 期刊论文。该章区分从当前个案构成预测的 internal approach,与借助相似情形分布资料的思路;它是理论与纠偏程序论述,没有提供后来五项大学生实验的样本。
Buehler、Griffin 与 Ross 1994 年才把完成时间问题拆成五项研究。Study 1 跟踪 37 名 honors thesis 学生:33 名完成者的一般预测平均 33.9 天,实际为 55.5 天;按全部 37 人计算,只有 29.7% 在预测日期内完成。另有 4 人在记录终止时尚未完成,没有进入完成时间均值,所以这些均值并不代表最慢的全部项目;较悲观的预测也没有降低绝对误差。
Study 2 把观察移到一周内的学业与非学业任务。两类任务的平均实际用时都接近预测的两倍;即使参与者预先知道研究会核对准确性,方向偏差仍未消失。完成时间均值只纳入已经结束的项目,实际日期又由参与者自报,这些限制使结果更适合说明“报早可能出现”,而非估计一般人的平均偏差。
Study 3 让 78 名参与者为近期学业任务边想边说。可编码内容中,未来情节约占 .74,过去经验约 .07,计划步骤又远多于障碍;解释自己的延期时,人们也比解释熟人延期更常诉诸外部、暂时或特定原因。这个组合提供了一条候选机制:注意力被当前情节占据,旧延期即使被提起,也容易以“不再适用”的解释退出估算。随访时有 70 人完成任务;另有 11 份录音不可辨,因此内容分析只纳入 67 人。出声思考也不是思想的完整记录;自选回忆可能确有不同,因此结果没有证明人是在防御自尊。
旧经验在这里遭遇的并非简单失忆。当前任务天然拥有姓名、步骤和眼前条件,容易被讲成一条具体因果链;过去任务则已压缩成结果和几项事后原因。只要每次延期都能获得一项局部解释,每个旧案例就可能分别被判出参考类,剩下的新项目再次显得独特。这是根据实验模式提出的作者解释,不代表研究已经测出某个单一心理过程;愿望、社会承诺、期限锚定和实际制度奖励也可能改变报告。
最关键的检验来自 Study 4。123 人被分为 control 41 人、recall 42 人、recall-relevant 40 人,完成约一小时的计算机教程;系统客观记录完成日期。只回忆相似任务的组,预测与实际为 5.3/6.3 天,与对照的 5.5/6.8 天一样仍偏早。必须说明旧经验怎样影响当前计划的组,预测与实际平均同为 7.0 天,平均方向偏差消失,60% 在预测内完成,对照为 29.3%。然而三组绝对误差没有显著差异,预测与实际的相关也没有增强。过去终于进入报价,却只是让过早和过晚大致抵消;“平均不偏”与“逐次准确”是两件事。
研究还把完成期限随机设为一周或两周,期限显著改变预测与实际完成时间。这说明下一次报告不只是对任务长度的被动读取:组织给出的日期也会成为预测与行动环境的一部分。于是旧延期是否进入估算,既取决于记忆关联,也取决于当前数字怎样锚定讨论。这个程序仍是短期教程,无法据此判定现实项目里两种力量各占多少。
Study 5 又把方向翻转。123 名观察者分成三组,每三人对应 Study 4 对照条件的一名执行者,分别看到对方对未来、过去或两者的思考。执行者平均预测 5.5 天、实际 6.8 天,偏早 1.3 天;观察者平均反向偏晚约 1.7 天,绝对准确度并未胜过执行者。远离当前情节可能增加分布资料的使用,也可能把方向从过早推到过晚。于是,“外面的人”并非天然正确的计时器。
五项研究都是加拿大大学便利样本,任务主要是论文、作业和短期日常活动。它们支持某些完成时间预测偏早,也把“单纯回忆”与“把回忆连到当前任务”分开;它们没有给工程成本、软件交付或一般人群提供统一发生率。2010 年同一研究团队发表的是叙事综述,并无统一样本或总体效应量,现有来源也没有定位到整套五研究的预注册独立直接复制。
误差口径一换,方向也可能改变
Halkjelsvik 与 Jørgensen 2012 年的综合综述进一步构成反例:工程与管理研究较常报告低估,心理学的 performance-time 研究却并非如此;所谓“小任务高估、大任务低估”还有一部分可能来自随机误差的统计假象。这没有推翻 planning fallacy,其意义在于要求分清口径。completion time 从预测算到交付,包含等待、打断、拖延和竞争任务;performance 或 effort time 只计直接工作时数;项目 cost overrun 还受范围、价格、汇率与合同变化影响。把三者合成一个“总是乐观”的效应,会制造并不存在的统一规律。
Flyvbjerg、Holm 与 Buhl 2002 年分析 258 个交通基础设施项目,来自 20 国、5 大洲,组合价值约 900 亿美元(1995 年价格)。他们把竣工核算的 construction cost 与 decision to build 时预测成本按固定价格比较,报告总平均 escalation 27.6%。这是一组按可得资料形成的观察样本:343 项有成本发展资料,85 项因口径、可靠性或未完成等质量问题排除;“1910—1998 年没有改善”的分析只涉及有年份资料的 111 项。方向性不对称值得重视,却无法分配认知偏差、蓄意低报、合同治理和范围变化各自的因果份额,更不授权把平均数加到任一新项目上。
reference class forecasting 试图让历史取得约束力:参考项目需要在类型、估算成熟阶段、范围、地域制度与成本口径上可比,再把项目特有信息作为可审计的调整理由。Batselier 与 Vanhoucke 2016 年在现实项目数据库中比较 RCF、Monte Carlo 与 earned value 等方法,摘要报告 RCF 表现最好;这项比较没有随机分派预测方法,参考类选择、调参与验证资料仍限制因果判断。英国后续指南也要求参考类既足够宽又足够相似,并与风险分析和专家判断结合。陈旧资料、分类选择偏差或结构突变,都可能让历史分布误导当前预测。
一次超支无法替人交代动机
Edinburgh Tram 把因果边界摆得很具体。2023 年调查报告记载,缩减后的 line 1a 成本为 7.767 亿英镑,比 5.45 亿英镑预算高 2.317 亿;项目约晚三年,于 2014 年 5 月运营,交付范围也已缩减。调查把主要失败指向 tie 的治理与执行,并认为 City of Edinburgh Council 对设计延误负主要共同责任;合同、设计、争议、治理和范围相互作用。
同一个“超预算、晚交付”表面,可以由不同机制生成。没有同期邮件、激励、决策记录与同口径基线,超支既不证明发起人无意识乐观,也不证明有人撒谎。若批准后安全标准、范围或价格改变,初始数与最终数还需要桥接。将后续 Newhaven extension 静默并入原线,只会用口径变化制造更戏剧化的故事。
所以,上次延期未进入下次估算,常见的断点不在记忆是否存在,而在旧经验是否被判为相关、是否以同一口径出现、是否抵得过当前情节与制度激励。把历史明确连到当前任务,可能纠正平均报早,也可能反向报晚,甚至维持同样大的绝对误差。工程、安全、财务、政府或医疗场景还须由相应专业估算、审计、风险与责任程序处理,学生实验和通用历史平均数都代替不了这些工作。
过去只有在口径可比、关联理由说得清、反例也被保留时,才会成为下一次预测的证据。记得延期是一段叙述;让它约束新日期,才是一次尚待检验的预测更新。
出处与限制
- 《孙子兵法·始计》,《续古逸丛书》本《武经七书》,中国哲学书电子化计划:https://ctext.org/art-of-war/laying-plans/ens。短引“五事七计”与“庙算”语境,只承担战争前审察的规范层,不作统计预测来源。
- Gospel of Luke 14:28—33, King James Version, Project Gutenberg eBook #10:https://www.gutenberg.org/ebooks/10。建塔、交战均服务于门徒代价的宗教比喻,不作估算偏差实验。
- Daniel Kahneman & Amos Tversky, “Intuitive Prediction: Biases and Corrective Procedures,” in S. Makridakis & S. C. Wheelwright (eds.), Forecasting, TIMS Studies in Management Science, vol. 12, North-Holland, 1979, pp. 313—327:https://www.econbiz.de/10002186528。题录与理论层使用;不与 Prospect Theory 或 1982 章混称。
- Roger Buehler, Dale Griffin & Michael Ross, “Exploring the ‘Planning Fallacy’: Why People Underestimate Their Task Completion Times,” Journal of Personality and Social Psychology 67(3), 366—381 (1994):https://doi.org/10.1037/0022-3514.67.3.366。五项加拿大大学研究逐项陈述;不合并样本,不外推公共工程成本。
- Roger Buehler, Dale Griffin & Johanna Peetz, “The Planning Fallacy: Cognitive, Motivational, and Social Origins,” Advances in Experimental Social Psychology 43, 1—62 (2010):https://doi.org/10.1016/S0065-2601(10)43001-4。叙事综述,无统一
N,不承担元分析或独立复制结论。 - Torleif Halkjelsvik & Magne Jørgensen, “From Origami to Software Development: A Review of Studies on Judgment-Based Predictions of Performance Time,” Psychological Bulletin 138(2), 238—271 (2012):https://pubmed.ncbi.nlm.nih.gov/22061688/。综合综述用于区分 performance time 与 completion time,并保留跨研究口径不一致。
- Bent Flyvbjerg, Mette K. Skamris Holm & Søren L. Buhl, “Underestimating Costs in Public Works Projects: Error or Lie?” Journal of the American Planning Association 68(3), 279—295 (2002):https://doi.org/10.1080/01944360208976273。
N=258是可得资料观察样本,成本口径与选择限制须与平均数并列。 - Jordy Batselier & Mario Vanhoucke, “Practical Application and Empirical Evaluation of Reference Class Forecasting for Project Management,” Project Management Journal 47(5), 36—51 (2016):https://doi.org/10.1177/875697281604700504。现实数据库比较并非随机现场试验;不报告未经全文复核的改善百分比。
- Edinburgh Tram Inquiry, Report of the Edinburgh Tram Inquiry (2023):https://www.edinburghtraminquiry.org/final_report/the-inquiry-report/edinburgh-tram-inquiry-report-signed/。只转述 restricted line 1a 的同口径数字与多机制治理结论,不并入后续 extension。
版本说明
简体中文为研究母稿,实质修订将记录日期并重新经过受影响门禁。
> 编辑状态:本文已完成独立事实与版权审校、匿名盲审及文字终校,并于 2026-07-18 获总编辑批准,进入分批发行。