Mars Research · 地球观测计划最近回传:2026年8月8日
rover.red

车载仪器 · Onboard Instrument

研究简报:预测(Forecasting)作为科技决策方法

研究日期:2026 年。用途:为研究网站的第一件核心工具“预测仪”提供深度论证——它不只是“对趋势给出概率判断”,而是一套有七十年谱系、有实证战绩、有明确边界的知识问责基础设施。


一、核心结论

  1. 预测是唯一可证伪、可计分、可追责的未来知识形式。 观点无法被判错,概率可以。从 RAND 的 Delphi(1950s)到 IARPA 的 ACE 锦标赛(2011–2015),七十年实证研究的核心发现是:预测能力是一种可测量、可训练、可聚合的真实技能——它不是专家的附属品,而是独立于专业身份的认知资产。
  2. 有严格计分的预测者大幅跑赢无问责的专家。 Good Judgment Project 的超级预测者比掌握机密情报的职业情报分析师准确率高约 25–30%;预测者以 300 天为期的准确率超过普通人对 100 天后的判断。预测市场在 2024 年美国大选中系统性领先民调最多 14 天。
  3. 预测的深层价值不在“猜中”,而在三件事:(a) 概率 + 公开校准 = 知识问责的基础设施;(b) 情景与稳健决策方法把“预测会失效”本身制度化(RAND 的 RDM:做好决策可以不依赖预测);(c) 预测行为会改变被预测的系统——这种反身性不是缺陷而是治理杠杆。
  4. 预测有明确边界。 Taleb 证明肥尾世界里二值准确率与真实风险无关;混沌系统存在硬性的可预测性视界;Tetlock 本人承认专家预测五年后趋于随机。预测仪的合法性恰恰来自它公开这些边界,而不是假装它们不存在。
  5. 对一个科技观察网站,落地形态已经成熟:预测登记簿 + 公开校准页 + 情景库,三个组件都有可直接参照的活样板(Metaculus Track Record、Manifold Calibration、ACX 年度校准、Shell 情景库)。

二、知识谱系:从 Delphi 到预测市场

2.1 Delphi 方法:让专家匿名对峙(RAND, 1950s)

2.2 Tetlock《Expert Political Judgment》(2005):专家的裸奔

  • Tetlock 用 20 年、284 名专家、约 28,000 条可计分预测得出著名结论:政治专家的平均准确率仅略好于随机(“掷飞镖的黑猩猩”),且被简单的外推模型击败。Expert Political Judgment (Princeton UP) · Everybody’s an Expert (The New Yorker)
  • 但真正的发现不是“专家无用”,而是认知风格决定准确率:思想多元、随时更新的“狐狸”系统性优于抱着单一宏大理论的“刺猬”——尽管刺猬因为叙事自信而更受媒体欢迎。这把问题从“谁是权威”转向了“什么样的思维习惯产生准确的未来判断”。Tetlock EPJ 书评 (Wharton PDF)

2.3 IARPA ACE 锦标赛与超级预测者(2011–2015):预测作为可实验科学

2.4 聚合方法:群体的概率比个人的更准

2.5 预测市场:用真金白银为概率定价

2.6 情景规划传统:当“猜中”不可能时

谱系小结:Delphi 把判断程序化 → Tetlock 把判断计分化 → ACE 把计分竞赛化 → 聚合与市场把判断资产化 → 情景与 RDM 把“判断必然失效”制度化。预测仪站在第五条线的延长线上:把这整套东西公开化、常驻化。


三、深层机制:为什么“给概率”是知识问责的基础设施

3.1 概率 > 观点的三个理由

  1. 可证伪性 = 可追责性。 模糊措辞是事后逃脱的通道。Tetlock 反复引用的猪湾事件:军方说计划有“fair chance”成功,写报告的人心里想的其实是 3:1 反对,而肯尼迪理解成了相当乐观。数字堵死了这种语义逃逸。AI Impacts(Superforecasting p44 转述)
  2. 概率可以进入决策演算。 期望效用、期权价值、对冲比例——所有正式的决策工具都以概率为输入;观点不能。Friedman、Mellers、Tetlock、Zeckhauser 等人的实证还显示:精确概率(而非四舍五入的粗粒度判断)本身携带额外信息,把超级预测者的估计取整到 0.1 会显著降低其分数——精度的价值是可测量的。The Value of Precision in Geopolitical Forecasting (NBER 会议论文)
  3. 概率可以聚合,观点只能折中。 聚合算法(加权 + 极端化)的输入是数字;而且“同一问题上的多次更新”本身是准确率的预测因子——只有数字化判断才能被时间序列化、被追踪更新轨迹。AI Impacts(同上)

3.2 校准与 Brier 分数:问责的度量衡

  • Brier 分数(1950 年提出)是预测概率与实际结果的均方误差,越低越好;它可分解为校准(你说 70% 的事是否真的七成发生)与分辨度(你是否敢于区分高低概率)。Metaculus: A Primer on the Scoring Rule · Brier score (Wikipedia)
  • 其基础设施意义在于:它把“信用”从声望函数变成了成绩函数。没有公开计分,“专家”靠头衔与叙事积累权威;有了公开校准曲线,任何人都可以用数据质询任何判断者。Metaculus 的全站 Track Record、Manifold 的校准页、brier.fyi 的跨平台比较,都是这套基础设施的活的实例。Metaculus Track Record · Brier.fyi
  • 更深一层:计分是学习的反馈回路。Tetlock 的“十诫”第十条本质上是“练习、练习、练习”——但练习的前提是知道自己错在哪。没有计分的预测只是感想。AI Impacts(同上)

3.3 反身性:预测改变被预测的系统

  • Merton 的自我实现预言:对情境的(错误)定义引出新行为,使原定义成真。预测从来不是系统外的观察。Self-fulfilling prophecy (Wikipedia)
  • 在算法时代这被形式化为 performative prediction:模型输出的分布会改变它要预测的分布(信用评分改变借贷行为、推荐系统改变偏好),再训练数据被自己污染,错误被“模型的真理”遮蔽。Perdomo et al.: Performative Prediction (ICML 2020) · Self-fulfilling Prophecy in Practical and Automated Prediction (Springer)
  • 科技领域的双重形态:自我实现(摩尔定律作为行业协调点、路线图牵引投资)与自我否定(Y2K 预警成功所以“什么都没发生”、气候预警推动减排)。启示:一个好的预测工具必须显式标注每条预测的反身性方向——它是希望被实现的,还是希望被证伪的。

四、批判与边界:预测在哪里失效

  1. Taleb 的黑天鹅批评——且它是对的(在适用范围内)。 Taleb 证明:在肥尾分布下,极端事件贡献绝大部分影响,大数定律在可用时间内不收敛,点预测毫无意义;更尖锐的是二值预测与真实收益的统计断裂——预测者可以靠猜中“冲突是否发生”积累声誉,同时对冲突的量级(真正重要的东西)一无所知。他借此直接回应过 Tetlock 的锦标赛范式。应对不是放弃预测,而是像 Taleb 建议的那样转向稳健性与生存性设计(这也正是 RAND RDM 的独立结论——两个对立学派在“深度不确定性下怎么办”上汇合了)。Taleb: On the Difference between Binary Prediction and True Risk (PDF) · Taleb et al.: On single point forecasts for fat-tailed variables (IJF) · On the statistical differences between binary forecasts and real-world payoffs
  2. 可预测性视界是物理量,不是态度问题。 混沌系统的误差以 Lyapunov 指数增长(多尺度系统中呈幂律),存在严格有限的预测视界;信息论上,当前数据与未来状态的互信息给任何方法的性能设了天花板。Power law error growth in multi-hierarchical chaotic systems (NJP) · Limits to extreme event forecasting in chaotic systems (arXiv) · Predictability limit of partially observed systems (Sci. Rep.)
  3. Tetlock 自己的边界声明:地缘政治预测约两年内有效、五年后专家准确率向随机退化、“没有证据表明任何人能预测十年后的事——除了显而易见的东西”。因此 ACE 式方法向长期科技预测的推广是开放问题而非既定事实AI Impacts 脚注 22(Superforecasting p243)
  4. 技术预测的历史成绩单很差:1890–1940 年间技术预测兑现率不足一半;大规模技术预见 Delphi 调查存在系统性乐观偏差;S 曲线模型对替代周期有效但常忽略技术与社会的共同演化。The accuracy of technological forecasts, 1890–1940 · Failed technology futures: pitfalls and lessons · A critical evaluation of 42 large-scale S&T foresight Delphi surveys
  5. 预测的政治性:谁来出题、谁的问题被量化、谁的未来被当作“基准情景”——这些从来不是中立的。Delphi 诞生于冷战军事需求;情景规划史学者批评 2x2 矩阵把复杂权力关系压缩成方便的四格漫画。预测工具必须公开“选题的政治”,否则它会悄悄把现状自然化。How to train your oracle: The Delphi method and its turbulent youth (Social Studies of Science) · A Critical History of Scenario Planning (Curry)

边界小结:预测在“可分解、有基率、有反馈、视界内”的问题上强大;在“肥尾、一次性、长视界、强反身”的问题上必须切换为情景 + 稳健决策模式。一个诚实的预测仪应该把这套切换逻辑写进产品本身。


五、对科技发展的价值:从技术预见到预期治理

  1. 技术预见(technology foresight)的实证转向:传统专家预见与实现结果的对比研究显示专家预测的系统性偏差,而定量方法总体优于定性方法、短视界优于长视界——这恰好是把科技判断改造为“可检验概率问题”的方法论依据。美国国家科学院的《Persistent Forecasting of Disruptive Technologies》已把持续预测(而非一次性报告)作为破坏性技术预警的制度形态。An examination of factors affecting accuracy in technology forecasts · Expert forecast and realized outcomes in technology foresight · NAP: Persistent Forecasting of Disruptive Technologies
  2. 预期治理(anticipatory governance)成为主流政策框架:OECD 的《Framework for Anticipatory Governance of Emerging Technologies》(2024)把战略情报(含前瞻与预测)、敏捷监管、利益相关方参与列为新兴技术治理的五大要素之一;2025 年又发布公共部门预期治理指南。预测从“智库副业”变成了政府治理能力的法定组件OECD: Framework for Anticipatory Governance of Emerging Technologies · OECD: Towards anticipatory governance guidelines (2025) · OECD: Strategic Foresight 主页
  3. 对科技决策的三个独特价值
    • 时间套利:如果最佳实践能把“有效预警期”从 100 天扩展到 300 天(ACE 实证),对 AI 里程碑、供应链冲击、监管窗口的决策价值巨大——300 天预警 vs 100 天预警是完全不同的战略处境。AI Impacts §2.2
    • 共识的压力测试:科技叙事(“AGI 明年到”“量子十年内无用”)在媒体中以观点形态流通、永不结算;转化为登记在册的概率判断后,叙事疲劳与叙事泡沫都会在校准曲线上现形。
    • 为情景规划提供“路标(signposts)”:Shell 传统中每个情景配套先行指标;概率预测正是路标的可计分版本——情景负责打开想象空间,预测负责告诉世界“我们正走在哪条路上”。二者是同一系统的两个图层。Shell: What scenario planning models does Shell use?

六、对一个研究网站的落地启示

6.1 组件一:预测登记簿(Prediction Registry)

6.2 组件二:公开校准页(Calibration Dashboard)

  • 形态:常驻页面,展示累计 Brier 分数、校准曲线(说 70% 的事实际发生了几成)、按主题/视界分解的成绩。
  • 直接样板Metaculus Track Record(全站校准曲线 + 分数史)、Manifold 平台校准页、跨平台比较器 brier.fyi
  • 设计要点:(a) 分数必须可分解——总分漂亮而某个领域(如 AI)一直糟糕,应一眼可见;(b) 公开更新频率:同一问题的多次修正轨迹本身是准确率资产,值得作为时间序列展示;(c) 像 Manifold 的 “Accuracy Trap” 研究那样,把失败模式写进方法学页面,而不是藏起来。

6.3 组件三:情景库(Scenario Library)

  • 形态:围绕核心议题(AI 进展、能源转型、地缘技术竞争等)维护 3–4 个质上不同的情景,每个情景配一组“路标”指标;路标即预测登记簿中的可计分问题——两个组件共享同一套数据基础设施。
  • 直接样板:Shell 持续公开其情景报告与方法页(Shell Scenarios);GBN 的 2x2 构造法提供了最低成本的起步模板(GBN: Plotting Your Scenarios),但应配合 Curry 的批判史阅读以避免“方便的四格”陷阱(A Critical History of Scenario Planning)。
  • 设计要点:对每个情景显式标注反身性(希望它实现还是希望它被避免);对深度不确定性议题,用 RDM 式表述(“在哪些条件下此策略失效”)替代概率表述(RAND RB9701)。

6.4 方法论原则(贯穿三个组件)

  1. 把边界写进产品:每条预测标注其“可预测性类别”(可计分二值 / 肥尾风险 / 深度不确定),分别对应概率、情景、稳健性三种输出——这是对 Taleb 批评的产品化回应。
  2. 选题的政治要公开:说明为什么选择这些问题、谁的利益相关——预测仪的可信度部分来自它对自己非中立性的坦白。
  3. 聚合留给读者:初期可以是单作者登记簿;成熟时开放访客预测并按成绩加权聚合(GJP 的精英聚合逻辑),网站本身成为一个小型锦标赛。
  4. 结算即内容:校准复盘(“我为什么错了”)是此类网站历史上最受欢迎的内容形态(ACX 的 Mantic Monday 即先例)——问责不是成本,是栏目。

七、来源取舍

保留(高价值)

  • AI Impacts: Evidence on good forecasting practices from the GJP — GJP 证据的最佳二手综合,含大量原始数据与诚实的不确定性注脚
  • Satopää/Baron/Mellers/Tetlock 系列论文(Decision Analysis / Operations Research)— 聚合与极端化的一手文献
  • Tetlock《Expert Political Judgment》(Princeton UP) 与 New Yorker 书评 — 专家判断实证的原典与高质量转述
  • RAND 原始文献(RM-727、P3558、RB9701、MR1626)— Delphi 与 RDM 的一手出处
  • Metaculus Track Record / Manifold Calibration / brier.fyi — 公开校准基础设施的活样本
  • MDPI/OSF/NYT 关于 Polymarket 2024 的研究与报道 — 预测市场 vs 民调的最近实证
  • Wack HBR 1985(经 Andrew W. Marshall Foundation 存档)与 strategy+business 的 Wack 传记 — 情景规划原典
  • Taleb 的两篇 International Journal of Forecasting 论文 — 对预测范式的最强学术批评
  • OECD 预期治理框架(2024/2025)— 政策制度化的一手文件
  • Merton/performativity 文献(Perdomo et al. ICML 2020)— 反身性的形式化

舍弃

  • monday.com、workshopweaver、nibmehub 等 SEO 工具站 — 二手教程,无增量信息
  • YouTube 视频、Medium 随笔、DEMAGAGA 书评 — 非权威转述
  • Hacker News / LessWrong 讨论帖(除直接引用的校准数据帖外)— 观点性内容,已由一手文献覆盖
  • “TradeAlgo 预测市场准确率” 等营销内容 — 利益相关方

八、盲区与未决问题

  1. GJP 证据能否外推到 5 年以上的科技预测? Tetlock 本人承认证据缺口;“Bayesian Question Clustering”(用短期可计分问题簇逼近长期问题)是已知最有希望的修补方案,但尚未有大规模验证。下一步:检索 IARPA 后续项目(如 FOCUS、HFMT)与 RAND/Santa Fe Institute 的长期科技预测实验。
  2. 极端化聚合的稳健性仍有学术争议(AI Impacts 采访的专家指出可能是锦标赛侥幸)。落地时应同时公布原始平均与极端化两个分数。
  3. 预测市场的流动性门槛:Manifold 研究显示校准需要最小交易者规模,一个小型研究网站的访客预测功能可能达不到该门槛——需要先以“登记簿”形态积累,再升级为“市场”形态。
  4. 中文世界的预测问责实践(如中文预测社区、智库公开校准记录)本次未系统检索,若网站面向中文读者,值得补一轮检索。
  5. 反身性的度量:performative prediction 的实证检测方法(如注入随机噪声)主要适用于算法系统;一个文本型预测网站如何检测自身影响力对结果的污染,仍是开放问题。