Scaling law 指的是随着模型参数量、训练数据量与算力投入的增加,模型的智能基准也会不断变强 1。在最开始我们讨论 scaling law 的时候,通常包含了一层隐含的语义:在训练时投入更多的算力。 而现在的 researcher 们发现,在推理时付诸更多努力(test-time compute2),也是让 agent 在复杂任务上取得更好效果的一个手段。这个理念甚至有那么一些仿生学的味道,经济学下尼尔·卡尼曼在《思考,快与慢》中提出人类有两种思考模式:快思考-直觉与慢思考-理性。
- 直觉:凭借肌肉记忆答题,假如问题比较复杂,那其实就近似于是在瞎蒙
- 理性:准备一张草稿纸,在纸上写写画画,不断验证自己的思路对不对,最终把题目做出来
当年
做空了英伟达引起轰动的 DeepSeek-R1 最突出的一个特点就是给模型准备了草稿纸,从而一下子提升了解决复杂任务的基准能力。
时至今日,慢思考的具体任务变得更系统化,大致可以分成下面几类工作
- Test-time search345
- 推理轨迹的检索,包括如何生成推理分支/分叉,推理路径评分、剪枝回溯、树搜索 / MCTS / beam search
- Extended deliberation,延长推理67
- 更长的CoT、更多内部推理轮次等。与具体推理轨迹不耦合
- Verification & refinement,验证与迭代改进89
- Critique、self-correction、反思、重写、代码/规则校验
- Tool-augmented inference,工具增强推理10
- 网页的检索与浏览、代码执行、计算器、环境交互
- Test-time adaptation,测试时适应11
- 利用当前任务/样本更新记忆、提示或少量参数
- Compute allocation / routing,计算分配/路由212
- 决定何时多想、调用哪个模型/工具、何时停止
慢思考对应到具体产品上,一般是所谓的Deep Search(Codex和Gemini都有对应的模式)。以后遇到复杂的问题,就不妨给大模型一张草稿纸,让它慢下来好好思考思考。
延伸资料:
- Why AI Models Pause to Think: Test Time Compute Explained
- 解释了为什么大模型需要停下来思考,以及算力是如何在推理阶段被消耗的
Footnotes
-
Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters ↩ ↩2
-
Self-Consistency Improves Chain of Thought Reasoning in Language Models — Wang et al. (2022) ↩
-
Training Verifiers to Solve Math Word Problems — Cobbe et al. (2021) ↩
-
Tree of Thoughts: Deliberate Problem Solving with Large Language Models — Yao et al. (2023) ↩
-
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models — Wei et al. (2022) ↩
-
Self-Refine: Iterative Refinement with Self-Feedback — Madaan et al. (2023) ↩
-
Reflexion: Language Agents with Verbal Reinforcement Learning — Shinn et al. (2023) ↩
-
ReAct: Synergizing Reasoning and Acting in Language Models — Yao et al. (2023) ↩
-
Test-Time Training with Self-Supervision for Generalization under Distribution Shifts — Sun et al. (2019) ↩
-
Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation — Manvi et al. (2024) ↩