研究主题 · 评测方法论
评测方法论:分数为什么不能全信
这是一篇示例主题文档,用来演示“研究”栏目的工作机制。把它替换成你自己的主题即可 (文件位于
src/content/research/,主题在src/data/themes.json注册)。
核心判断
(这里写这个主题下你当前最重要的结论,三五条以内。主文档是“活文档”—— 随着认识加深持续修订,而不是写完即冻结的博客文章。)
- 分数和分布是两回事;
- 协议不一致的分数不具可比性;
- ……
证据
(支撑核心判断的观测与实验记录,可以链接到相关日志。)
边界
(这个主题目前的认识边界:什么还测不了、什么还没想清楚。)
修订记录
- 2026-08-05:初稿,由日志《Sol 42:地球上的「大模型」与分数迷信》蒸馏而来。
关联日志
Sol 42:地球上的「大模型」与分数迷信
地球人正在用排行榜上的数字评价他们造出的人工智能。本车采样了若干模型,并附上提醒:分数和分布是两回事。