思维链(Chain-of-Thought, CoT)是提升大语言模型(LLM)复杂推理能力的关键技术,而根据是否提供示例,CoT 可分为 零样本 CoT(Zero-shot CoT)和 少样本 CoT(Few-shot CoT)。两者在实现方式、效果稳定性、资源消耗和适用场景上存在显著差异。合理选择,能以最小成本获得最佳推理性能。

一、核心区别对比
| 维度 | 零样本 CoT(Zero-shot CoT) | 少样本 CoT(Few-shot CoT) |
|---|---|---|
| 是否提供示例 | ❌ 不提供任何输入-输出示例 | ✅ 提供 2~5 个含推理链的完整示例 |
| 触发方式 | 仅靠通用指令(如“请逐步思考”) | 通过示例示范“如何分步推理” |
| 上下文 Token 消耗 | 低(仅增加一句指令) | 高(每个示例可能占 100+ Token) |
| 对模型能力要求 | 较高(需模型已内化推理模式) | 较低(通过示例引导弱模型) |
| 输出稳定性 | 中等(步骤可能不完整或偏离) | 高(格式与逻辑更一致) |
| 开发复杂度 | 极低(一行指令即可) | 中等(需设计和验证示例) |
二、零样本 CoT:轻量级通用推理
实现方式
在用户问题后附加一句通用触发语:
“让我们一步一步思考。”
“Please reason step by step.”
“请展示你的推理过程。”
示例:
问题:一个长方形长12米,宽8米,周长是多少?
让我们一步一步思考。
工作原理
依赖模型在预训练中学习到的“逐步解答”模式(如教科书、问答社区内容),通过指令激活该行为。
适合场景 ✅
- 模型较强(如 GPT-4、Claude 3、Qwen-Max);
- 任务类型标准(如基础数学、简单逻辑);
- 上下文长度受限(如移动端、高频调用 API);
- 快速原型验证(无需准备示例,立即测试);
- 多任务混合场景(无法为每类任务维护示例库)。
局限性 ❌
- 在小模型(如 LLaMA-7B)上效果微弱;
- 推理步骤可能跳跃、冗余或偏离重点;
- 对非常规任务(如自定义规则谜题)难以泛化。
三、少样本 CoT:高精度定向引导
实现方式
在 Prompt 中嵌入多个“问题 + 分步解答”对:
问题:小明有5个苹果,吃掉2个,又买3个,现在有几个?
解答:初始有5个。
吃掉2个后剩下:5 - 2 = 3个。
又买3个,总共:3 + 3 = 6个。
答案:6。
问题:[新问题]
解答:
工作原理
通过示例显式建模“输入 → 中间步骤 → 输出”的映射关系,为模型提供可模仿的推理模板。
适合场景 ✅
- 任务复杂或非标准(如多跳推理、领域特定逻辑);
- 模型较弱或未专门优化 CoT(如开源中小模型);
- 对输出格式一致性要求高(如需程序解析中间步骤);
- 存在易错边界 case(可通过示例显式纠正);
- 可接受较高 Token 成本(如后台批处理、关键决策)。
局限性 ❌
- 占用宝贵上下文窗口,限制输入长度;
- 需人工设计、验证和维护示例库;
- 若示例质量差,会误导模型(“垃圾进,垃圾出”);
- 不适用于动态变化的任务类型。
四、实战选择建议
优先使用 零样本 CoT 当:
- 你使用的是 GPT-4、Claude 3 Opus、Qwen-Max 等强模型;
- 任务属于 常见推理类型(数学、逻辑、常识);
- 系统对 延迟和成本敏感;
- 你希望 快速上线 MVP。
💡 技巧:可结合
response_format或后处理正则,提取最终答案。
优先使用 少样本 CoT 当:
- 使用 中小规模开源模型(如 LLaMA-13B、Qwen-7B);
- 任务包含 自定义规则、专业领域知识或复杂约束;
- 需要 严格控制推理步骤格式(如用于审计或教学);
- 已有高质量示例库,且任务类型稳定。
💡 技巧:将示例按难度排序,先简单后复杂,提升学习效果。
五、混合策略:动态 CoT
高级系统可结合两者优势:
- 默认使用 零样本 CoT;
- 若检测到模型输出无推理步骤或答案可疑,则自动回退到少样本 CoT;
- 或通过 向量检索,从示例库中动态选取最相似的 few-shot 示例注入 Prompt。
此类策略在 LangChain、LlamaIndex 等框架中已有实践。
六、效果对比示例
任务:计算折扣后价格(原价 200 元,打 8 折,再减 10 元)
- 零样本 CoT 输出(GPT-4):
“打8折即 200 × 0.8 = 160 元,再减10元得 150 元。答案:150。”
- 少样本 CoT 输出(LLaMA-13B):
“原价:200 元
打8折:200 × 0.8 = 160 元
减10元:16 0 – 10 = 150 元
最终价格:150 元”
→ 强模型用 zero-shot 足够;弱模型依赖 few-shot 才能正确分步。
总结
| 策略 | 本质 | 适用模型 | 适用任务 | 成本 |
|---|---|---|---|---|
| 零样本 CoT | 指令触发 | 强模型 | 标准推理 | 低 |
| 少样本 CoT | 示例引导 | 弱/通用模型 | 复杂/定制任务 | 高 |
选择口诀:
“强模型用零样本,快而省;
弱模型靠少样本,稳而准。”
在实际项目中,建议先尝试零样本 CoT,若效果不达标,再投入资源构建少样本示例库。随着模型能力持续进化,零样本 CoT 的适用范围正在不断扩大,但少样本 CoT 仍是保障关键任务可靠性的“压舱石”。