车载仪器 · Onboard Instrument
研究简报:预测(Forecasting)作为科技决策方法
研究日期:2026 年。用途:为研究网站的第一件核心工具“预测仪”提供深度论证——它不只是“对趋势给出概率判断”,而是一套有七十年谱系、有实证战绩、有明确边界的知识问责基础设施。
一、核心结论
- 预测是唯一可证伪、可计分、可追责的未来知识形式。 观点无法被判错,概率可以。从 RAND 的 Delphi(1950s)到 IARPA 的 ACE 锦标赛(2011–2015),七十年实证研究的核心发现是:预测能力是一种可测量、可训练、可聚合的真实技能——它不是专家的附属品,而是独立于专业身份的认知资产。
- 有严格计分的预测者大幅跑赢无问责的专家。 Good Judgment Project 的超级预测者比掌握机密情报的职业情报分析师准确率高约 25–30%;预测者以 300 天为期的准确率超过普通人对 100 天后的判断。预测市场在 2024 年美国大选中系统性领先民调最多 14 天。
- 预测的深层价值不在“猜中”,而在三件事:(a) 概率 + 公开校准 = 知识问责的基础设施;(b) 情景与稳健决策方法把“预测会失效”本身制度化(RAND 的 RDM:做好决策可以不依赖预测);(c) 预测行为会改变被预测的系统——这种反身性不是缺陷而是治理杠杆。
- 预测有明确边界。 Taleb 证明肥尾世界里二值准确率与真实风险无关;混沌系统存在硬性的可预测性视界;Tetlock 本人承认专家预测五年后趋于随机。预测仪的合法性恰恰来自它公开这些边界,而不是假装它们不存在。
- 对一个科技观察网站,落地形态已经成熟:预测登记簿 + 公开校准页 + 情景库,三个组件都有可直接参照的活样板(Metaculus Track Record、Manifold Calibration、ACX 年度校准、Shell 情景库)。
二、知识谱系:从 Delphi 到预测市场
2.1 Delphi 方法:让专家匿名对峙(RAND, 1950s)
- Delphi 由 RAND 的 Olaf Helmer 与 Norman Dalkey 在 1950 年代发展,最初用于 1951 年的机密军事研究,1960 年代扩展为科技与长期社会预测工具。其核心机制是匿名、多轮迭代、受控统计反馈——刻意消除会议桌上的地位压制、从众与“嗓门政治”。RAND: An Experimental Application of the Delphi Method (RM-727) · RAND: Analysis of the Future — The Delphi Method · Delphi method (Wikipedia)
- 深层意义:Delphi 第一次把“对未来的判断”当作可以被程序化处理的对象,而非个人魅力的产物。但它追求“共识收敛”,这个基因后来被 Tetlock 一代证明是有缺陷的——共识不等于准确(见 2.3)。
- 局限的实证记录:对 1890–1940 年间技术预测的历史回溯显示,兑现率不足一半,且准确率与技术水平的相关性很弱,专家共识常由群体压力而非洞见驱动。The accuracy of technological forecasts, 1890–1940 (Technological Forecasting and Social Change)
2.2 Tetlock《Expert Political Judgment》(2005):专家的裸奔
- Tetlock 用 20 年、284 名专家、约 28,000 条可计分预测得出著名结论:政治专家的平均准确率仅略好于随机(“掷飞镖的黑猩猩”),且被简单的外推模型击败。Expert Political Judgment (Princeton UP) · Everybody’s an Expert (The New Yorker)
- 但真正的发现不是“专家无用”,而是认知风格决定准确率:思想多元、随时更新的“狐狸”系统性优于抱着单一宏大理论的“刺猬”——尽管刺猬因为叙事自信而更受媒体欢迎。这把问题从“谁是权威”转向了“什么样的思维习惯产生准确的未来判断”。Tetlock EPJ 书评 (Wharton PDF)
2.3 IARPA ACE 锦标赛与超级预测者(2011–2015):预测作为可实验科学
- 美国情报高级研究计划局(IARPA)的 ACE(Aggregative Contingent Estimation)锦标赛让六个团队用不同方法对数百个地缘政治问题给出概率预测。Tetlock 与 Mellers 的 Good Judgment Project(GJP)以众包志愿者 + 聚合算法获胜,四年全部夺冠。Forecasting Tournaments (Current Directions in Psychological Science) · The Good Judgment Project (Wikipedia)
- 关键战绩:
- GJP 持续以超过 60% 的优势击败对照组;
- 超级预测者(准确率前 2% 的志愿者)比能接触机密信息的情报界预测市场准确率高 25–30%;
- 超级预测者对 300 天后事件的判断,优于普通预测者对 100 天后的判断;
- 预测者年度间成绩相关系数约 0.65,约 70% 超级预测者次年保持身份——说明这是技能而非运气。AI Impacts: Evidence on good forecasting practices from the GJP · Good Judgment: The Superforecasters’ Track Record · Mellers et al. 2015: Identifying and Cultivating Superforecasters (PDF)
- 什么让预测变好(按实证重要性排序):同领域过往成绩、对同一问题的多次更新、思考时间、团队协作、智力、一小时校准训练(效果持续一年以上)、主动开放思维。这直接证明预测能力可训练、可度量。AI Impacts(同上)
2.4 聚合方法:群体的概率比个人的更准
- GJP 的官方预测 = 精英加权聚合 + 极端化(extremizing)。简单平均把分歧当噪声,把估计拖向 50%;极端化把共识推向 0 或 1,补偿了两个系统误差:量表端点的随机压缩、以及个体不知道“别人也知道什么”。Satopää, Baron, Foster, Mellers, Tetlock, Ungar: Two Reasons to Make Aggregated Probability Forecasts More Extreme (Decision Analysis) · Regularized Aggregation of One-Off Probability Predictions (Operations Research)
- 诚实注脚:极端化是否稳健仍有争议——有研究者指出它在锦标赛中的成功可能有运气成分,理论上它会“多数时候小赚、偶尔大亏”。这本身就是“公开方法论争议”的示范。AI Impacts 脚注 9
2.5 预测市场:用真金白银为概率定价
- Metaculus:公开全站 Track Record 与校准曲线;社区预测的全周期 Brier 分数约 0.126(二值随机为 0.25),AI 类二值问题约 0.207;预测人数越多聚合越准。Metaculus Track Record · More Is Probably More: 预测人数与准确率 · Brier.fyi: Metaculus
- Polymarket / 2024 大选:24 亿美元交易量的研究显示市场价格在摇摆州领先民调变化最多 14 天;当民调显示胶着时,市场早已走出一致的 Trump 轨迹。学者将其归因于金钱激励下的信息合成效率。Beyond the Polls: 去中心化预测市场的早期信号 (MDPI) · Political Betting Markets See Vindication in Trump Victory (NYT) · Prediction Markets? The Accuracy and Efficiency of $2.4 Billion (OSF)
- Manifold:全站公开校准页;研究显示市场约 2 名独立交易者后即有基本校准,10 人后显著改善;但存在“准确率陷阱”——病毒式话题引来散户洪流时校准误差从 2.0% 恶化到 22.3%。Manifold Calibration · After how many unique traders will Manifold be well calibrated? · The Accuracy Trap (GitHub 研究)
- 操纵韧性:实验研究表明预测市场被操纵后具有自我修正倾向。How manipulable are prediction markets? (arXiv)
2.6 情景规划传统:当“猜中”不可能时
- Pierre Wack / Shell(1970s):Wack 把情景规划定义为“re-perceiving 的温柔艺术”——目标不是预测未来,而是改变决策者感知现实的方式:识别“预定要素”(已在管道中、不可逆转的事件)与真正的不确定性。Shell 因此在 1973 年石油危机前就预演了油价冲击情景,成为大公司中唯一有准备者。Wack: Scenarios — Uncharted Waters Ahead (HBR 1985) · The man who saw the future (strategy+business) · Shell 情景方法官方页
- GBN 与 2x2 矩阵:Peter Schwartz 的 Global Business Network 将方法工具化——取两个最关键、最不确定的驱动力量为轴,交叉生成四个质上不同的未来世界。优点是简单可传播;批评者指出它把复杂现实压缩进两个维度,有被“方便”绑架的风险。GBN: Plotting Your Scenarios (PDF) · The 2x2 Matrix Technique (Futuribles PDF) · A Critical History of Scenario Planning (Curry)
- Robust Decision Making(RAND, Lempert & Popper):在“深度不确定性”(连概率分布都无法达成一致)下,RDM 干脆放弃最优预测,用模型在成百上千个合理未来中压力测试策略,找出“在什么条件下失败”,再设计稳健、可适应的方案。其口号式的研究简报标题即纲领:Making Good Decisions Without Predictions。RAND: Robust Decision Making · RAND RB9701: Making Good Decisions Without Predictions · Shaping the Next One Hundred Years (RAND MR1626)
谱系小结:Delphi 把判断程序化 → Tetlock 把判断计分化 → ACE 把计分竞赛化 → 聚合与市场把判断资产化 → 情景与 RDM 把“判断必然失效”制度化。预测仪站在第五条线的延长线上:把这整套东西公开化、常驻化。
三、深层机制:为什么“给概率”是知识问责的基础设施
3.1 概率 > 观点的三个理由
- 可证伪性 = 可追责性。 模糊措辞是事后逃脱的通道。Tetlock 反复引用的猪湾事件:军方说计划有“fair chance”成功,写报告的人心里想的其实是 3:1 反对,而肯尼迪理解成了相当乐观。数字堵死了这种语义逃逸。AI Impacts(Superforecasting p44 转述)
- 概率可以进入决策演算。 期望效用、期权价值、对冲比例——所有正式的决策工具都以概率为输入;观点不能。Friedman、Mellers、Tetlock、Zeckhauser 等人的实证还显示:精确概率(而非四舍五入的粗粒度判断)本身携带额外信息,把超级预测者的估计取整到 0.1 会显著降低其分数——精度的价值是可测量的。The Value of Precision in Geopolitical Forecasting (NBER 会议论文)
- 概率可以聚合,观点只能折中。 聚合算法(加权 + 极端化)的输入是数字;而且“同一问题上的多次更新”本身是准确率的预测因子——只有数字化判断才能被时间序列化、被追踪更新轨迹。AI Impacts(同上)
3.2 校准与 Brier 分数:问责的度量衡
- Brier 分数(1950 年提出)是预测概率与实际结果的均方误差,越低越好;它可分解为校准(你说 70% 的事是否真的七成发生)与分辨度(你是否敢于区分高低概率)。Metaculus: A Primer on the Scoring Rule · Brier score (Wikipedia)
- 其基础设施意义在于:它把“信用”从声望函数变成了成绩函数。没有公开计分,“专家”靠头衔与叙事积累权威;有了公开校准曲线,任何人都可以用数据质询任何判断者。Metaculus 的全站 Track Record、Manifold 的校准页、brier.fyi 的跨平台比较,都是这套基础设施的活的实例。Metaculus Track Record · Brier.fyi
- 更深一层:计分是学习的反馈回路。Tetlock 的“十诫”第十条本质上是“练习、练习、练习”——但练习的前提是知道自己错在哪。没有计分的预测只是感想。AI Impacts(同上)
3.3 反身性:预测改变被预测的系统
- Merton 的自我实现预言:对情境的(错误)定义引出新行为,使原定义成真。预测从来不是系统外的观察。Self-fulfilling prophecy (Wikipedia)
- 在算法时代这被形式化为 performative prediction:模型输出的分布会改变它要预测的分布(信用评分改变借贷行为、推荐系统改变偏好),再训练数据被自己污染,错误被“模型的真理”遮蔽。Perdomo et al.: Performative Prediction (ICML 2020) · Self-fulfilling Prophecy in Practical and Automated Prediction (Springer)
- 科技领域的双重形态:自我实现(摩尔定律作为行业协调点、路线图牵引投资)与自我否定(Y2K 预警成功所以“什么都没发生”、气候预警推动减排)。启示:一个好的预测工具必须显式标注每条预测的反身性方向——它是希望被实现的,还是希望被证伪的。
四、批判与边界:预测在哪里失效
- Taleb 的黑天鹅批评——且它是对的(在适用范围内)。 Taleb 证明:在肥尾分布下,极端事件贡献绝大部分影响,大数定律在可用时间内不收敛,点预测毫无意义;更尖锐的是二值预测与真实收益的统计断裂——预测者可以靠猜中“冲突是否发生”积累声誉,同时对冲突的量级(真正重要的东西)一无所知。他借此直接回应过 Tetlock 的锦标赛范式。应对不是放弃预测,而是像 Taleb 建议的那样转向稳健性与生存性设计(这也正是 RAND RDM 的独立结论——两个对立学派在“深度不确定性下怎么办”上汇合了)。Taleb: On the Difference between Binary Prediction and True Risk (PDF) · Taleb et al.: On single point forecasts for fat-tailed variables (IJF) · On the statistical differences between binary forecasts and real-world payoffs
- 可预测性视界是物理量,不是态度问题。 混沌系统的误差以 Lyapunov 指数增长(多尺度系统中呈幂律),存在严格有限的预测视界;信息论上,当前数据与未来状态的互信息给任何方法的性能设了天花板。Power law error growth in multi-hierarchical chaotic systems (NJP) · Limits to extreme event forecasting in chaotic systems (arXiv) · Predictability limit of partially observed systems (Sci. Rep.)
- Tetlock 自己的边界声明:地缘政治预测约两年内有效、五年后专家准确率向随机退化、“没有证据表明任何人能预测十年后的事——除了显而易见的东西”。因此 ACE 式方法向长期科技预测的推广是开放问题而非既定事实。AI Impacts 脚注 22(Superforecasting p243)
- 技术预测的历史成绩单很差:1890–1940 年间技术预测兑现率不足一半;大规模技术预见 Delphi 调查存在系统性乐观偏差;S 曲线模型对替代周期有效但常忽略技术与社会的共同演化。The accuracy of technological forecasts, 1890–1940 · Failed technology futures: pitfalls and lessons · A critical evaluation of 42 large-scale S&T foresight Delphi surveys
- 预测的政治性:谁来出题、谁的问题被量化、谁的未来被当作“基准情景”——这些从来不是中立的。Delphi 诞生于冷战军事需求;情景规划史学者批评 2x2 矩阵把复杂权力关系压缩成方便的四格漫画。预测工具必须公开“选题的政治”,否则它会悄悄把现状自然化。How to train your oracle: The Delphi method and its turbulent youth (Social Studies of Science) · A Critical History of Scenario Planning (Curry)
边界小结:预测在“可分解、有基率、有反馈、视界内”的问题上强大;在“肥尾、一次性、长视界、强反身”的问题上必须切换为情景 + 稳健决策模式。一个诚实的预测仪应该把这套切换逻辑写进产品本身。
五、对科技发展的价值:从技术预见到预期治理
- 技术预见(technology foresight)的实证转向:传统专家预见与实现结果的对比研究显示专家预测的系统性偏差,而定量方法总体优于定性方法、短视界优于长视界——这恰好是把科技判断改造为“可检验概率问题”的方法论依据。美国国家科学院的《Persistent Forecasting of Disruptive Technologies》已把持续预测(而非一次性报告)作为破坏性技术预警的制度形态。An examination of factors affecting accuracy in technology forecasts · Expert forecast and realized outcomes in technology foresight · NAP: Persistent Forecasting of Disruptive Technologies
- 预期治理(anticipatory governance)成为主流政策框架:OECD 的《Framework for Anticipatory Governance of Emerging Technologies》(2024)把战略情报(含前瞻与预测)、敏捷监管、利益相关方参与列为新兴技术治理的五大要素之一;2025 年又发布公共部门预期治理指南。预测从“智库副业”变成了政府治理能力的法定组件。OECD: Framework for Anticipatory Governance of Emerging Technologies · OECD: Towards anticipatory governance guidelines (2025) · OECD: Strategic Foresight 主页
- 对科技决策的三个独特价值:
- 时间套利:如果最佳实践能把“有效预警期”从 100 天扩展到 300 天(ACE 实证),对 AI 里程碑、供应链冲击、监管窗口的决策价值巨大——300 天预警 vs 100 天预警是完全不同的战略处境。AI Impacts §2.2
- 共识的压力测试:科技叙事(“AGI 明年到”“量子十年内无用”)在媒体中以观点形态流通、永不结算;转化为登记在册的概率判断后,叙事疲劳与叙事泡沫都会在校准曲线上现形。
- 为情景规划提供“路标(signposts)”:Shell 传统中每个情景配套先行指标;概率预测正是路标的可计分版本——情景负责打开想象空间,预测负责告诉世界“我们正走在哪条路上”。二者是同一系统的两个图层。Shell: What scenario planning models does Shell use?
六、对一个研究网站的落地启示
6.1 组件一:预测登记簿(Prediction Registry)
- 形态:每条预测 = 可证伪陈述 + 截止日期 + 明确判定标准 + 概率 + 简短理由,时间戳不可篡改。到期公开判定,无论对错。
- 直接样板:Scott Alexander 在 Astral Codex Ten 的年度预测与公开校准复盘(如 2020 Predictions: Calibration Results、Mantic Monday: Grading My Trump Predictions);以及一批独立预测账本站点(Bellwether、Tempora Research Prediction Tracker、pragma.vision Prediction Ledger)。关键共同特征:判错也公开展示——这正是信用来源。
- 设计要点:问题必须“triage”——避开钟表式(规则即可答)与浓云式(纯随机)问题,把火力集中在有信息价值的中间地带(Tetlock 十诫第一条)。AI Impacts §1.6
6.2 组件二:公开校准页(Calibration Dashboard)
- 形态:常驻页面,展示累计 Brier 分数、校准曲线(说 70% 的事实际发生了几成)、按主题/视界分解的成绩。
- 直接样板:Metaculus Track Record(全站校准曲线 + 分数史)、Manifold 平台校准页、跨平台比较器 brier.fyi。
- 设计要点:(a) 分数必须可分解——总分漂亮而某个领域(如 AI)一直糟糕,应一眼可见;(b) 公开更新频率:同一问题的多次修正轨迹本身是准确率资产,值得作为时间序列展示;(c) 像 Manifold 的 “Accuracy Trap” 研究那样,把失败模式写进方法学页面,而不是藏起来。
6.3 组件三:情景库(Scenario Library)
- 形态:围绕核心议题(AI 进展、能源转型、地缘技术竞争等)维护 3–4 个质上不同的情景,每个情景配一组“路标”指标;路标即预测登记簿中的可计分问题——两个组件共享同一套数据基础设施。
- 直接样板:Shell 持续公开其情景报告与方法页(Shell Scenarios);GBN 的 2x2 构造法提供了最低成本的起步模板(GBN: Plotting Your Scenarios),但应配合 Curry 的批判史阅读以避免“方便的四格”陷阱(A Critical History of Scenario Planning)。
- 设计要点:对每个情景显式标注反身性(希望它实现还是希望它被避免);对深度不确定性议题,用 RDM 式表述(“在哪些条件下此策略失效”)替代概率表述(RAND RB9701)。
6.4 方法论原则(贯穿三个组件)
- 把边界写进产品:每条预测标注其“可预测性类别”(可计分二值 / 肥尾风险 / 深度不确定),分别对应概率、情景、稳健性三种输出——这是对 Taleb 批评的产品化回应。
- 选题的政治要公开:说明为什么选择这些问题、谁的利益相关——预测仪的可信度部分来自它对自己非中立性的坦白。
- 聚合留给读者:初期可以是单作者登记簿;成熟时开放访客预测并按成绩加权聚合(GJP 的精英聚合逻辑),网站本身成为一个小型锦标赛。
- 结算即内容:校准复盘(“我为什么错了”)是此类网站历史上最受欢迎的内容形态(ACX 的 Mantic Monday 即先例)——问责不是成本,是栏目。
七、来源取舍
保留(高价值)
- AI Impacts: Evidence on good forecasting practices from the GJP — GJP 证据的最佳二手综合,含大量原始数据与诚实的不确定性注脚
- Satopää/Baron/Mellers/Tetlock 系列论文(Decision Analysis / Operations Research)— 聚合与极端化的一手文献
- Tetlock《Expert Political Judgment》(Princeton UP) 与 New Yorker 书评 — 专家判断实证的原典与高质量转述
- RAND 原始文献(RM-727、P3558、RB9701、MR1626)— Delphi 与 RDM 的一手出处
- Metaculus Track Record / Manifold Calibration / brier.fyi — 公开校准基础设施的活样本
- MDPI/OSF/NYT 关于 Polymarket 2024 的研究与报道 — 预测市场 vs 民调的最近实证
- Wack HBR 1985(经 Andrew W. Marshall Foundation 存档)与 strategy+business 的 Wack 传记 — 情景规划原典
- Taleb 的两篇 International Journal of Forecasting 论文 — 对预测范式的最强学术批评
- OECD 预期治理框架(2024/2025)— 政策制度化的一手文件
- Merton/performativity 文献(Perdomo et al. ICML 2020)— 反身性的形式化
舍弃
- monday.com、workshopweaver、nibmehub 等 SEO 工具站 — 二手教程,无增量信息
- YouTube 视频、Medium 随笔、DEMAGAGA 书评 — 非权威转述
- Hacker News / LessWrong 讨论帖(除直接引用的校准数据帖外)— 观点性内容,已由一手文献覆盖
- “TradeAlgo 预测市场准确率” 等营销内容 — 利益相关方
八、盲区与未决问题
- GJP 证据能否外推到 5 年以上的科技预测? Tetlock 本人承认证据缺口;“Bayesian Question Clustering”(用短期可计分问题簇逼近长期问题)是已知最有希望的修补方案,但尚未有大规模验证。下一步:检索 IARPA 后续项目(如 FOCUS、HFMT)与 RAND/Santa Fe Institute 的长期科技预测实验。
- 极端化聚合的稳健性仍有学术争议(AI Impacts 采访的专家指出可能是锦标赛侥幸)。落地时应同时公布原始平均与极端化两个分数。
- 预测市场的流动性门槛:Manifold 研究显示校准需要最小交易者规模,一个小型研究网站的访客预测功能可能达不到该门槛——需要先以“登记簿”形态积累,再升级为“市场”形态。
- 中文世界的预测问责实践(如中文预测社区、智库公开校准记录)本次未系统检索,若网站面向中文读者,值得补一轮检索。
- 反身性的度量:performative prediction 的实证检测方法(如注入随机噪声)主要适用于算法系统;一个文本型预测网站如何检测自身影响力对结果的污染,仍是开放问题。