少样本提示:用示例教会大模型完成任务
少样本提示(Few-Shot Prompting)是提示工程里最常用、也最容易被低估的技术。它的核心极其简单:把几个「输入-输出」示例直接写进提示,让模型照着样子完成任务,全程不需要任何参数更新。这种能力叫做上下文学习(In-Context Learning, ICL)。本文从原理、示例编排、与零样本及微调的取舍、推理模型下的新变化,以及失败模式五个角度讲清楚它。
定义与原理:从 GPT-3 说起
上下文学习指模型在推理阶段仅凭提示中的若干示例,就能在新输入上给出符合示例模式的输出,而权重保持不变。按示例数量分为零样本(Zero-shot,不给示例)、单样本(One-shot)与少样本(Few-shot,通常给 3 到 10 个示例)。
为什么权重没动,看几个例子就能学会?Brown 等 2020 年提出的 GPT-3 论文【已核验,arXiv:2005.14165】给出关键解释:海量预训练让超大模型(GPT-3 达 1750 亿参数)隐式学会了「从上下文中快速适配新任务」的元能力。后续研究进一步从隐式贝叶斯推断视角说明:示例越多越一致,模型对「符合这些示例的概念」的后验概率越集中,输出越稳定。
任务:把影评分类为「正面」或「负面」。
影评:服务态度太差,不会再来了。
情感:负面
影评:画面震撼,剧情很打动人。
情感:正面
影评:演员表演到位,值得二刷。
情感:
模型会续写出「正面」。注意示例已经隐含了格式约定。
示例编排:相关性、多样性与排序
示例并非越多越好,也非随便给几个就行。
相关性:示例应与目标任务高度相关,最好覆盖任务中的典型子情况。做意图识别时,示例应分别覆盖「查询」「投诉」「建议」等,而非全给查询类。
多样性:避免重复同一模式,否则模型误以为任务分布很窄,处理未见情况易出错。
排序:少样本对顺序敏感,存在近因效应,靠近输出的示例影响更大。实践中把最标准、最相关的示例放在末尾更稳定。同时用清晰稳定的分隔符(空行或固定前缀)区隔示例与任务输入,防止模型把示例内容当成输入来答。
格式一致性与分隔符
所有示例必须保持相同结构:相同字段名、相同分隔、相同标签写法。若前两个写「情感:正面」,第三个却写「结果=正面」,模型可能被带偏。标签分布也要注意:示例里 9 成标「正面」,模型会倾向把新输入也判为正面。因此示例标签比例应尽量贴合真实分布,未知时保持各类均衡最稳妥。
# 推荐:结构统一
句子:今天天气真好。
类别:积极
句子:这产品根本用不了。
类别:消极
与 Zero-shot、微调的取舍
相比零样本,少样本用示例显式校准了「任务是什么」与「答案该长什么样」,效果通常更稳。
相比微调(Fine-tuning),少样本优势在零训练成本、即时上线、易迭代,适合任务多变、数据稀缺或快速验证;天花板在受上下文长度限制、对分布偏移敏感、可复现性弱、对超出模型已有能力的任务无助。务实原则是:先用少样本快速验证可行性,当示例塞不下、效果不稳或需长期稳定服务时,再上微调或检索增强。
推理模型下的边际变化
近年出现的推理模型(如 OpenAI o1 系列、DeepSeek-R1 等)会在内部自行展开长链推理。对此类模型,少样本的边际收益往往变小:它们本身已具备稳定的思考过程,简单直接的零样本提示常常就够用,额外塞入示例有时反而约束其推理路径、带来轻微退化【待核实:该观察多见于厂商使用建议与社区实测,缺乏统一量化结论】。因此在推理模型上,建议先试零样本,仅在格式对齐或特定风格约束时少量加示例,并对照效果决定。
失败模式与对策
示例偏见(Demonstration Bias):示例标签分布失衡会系统性带偏新输入。对策是均衡示例标签、贴合真实先验。
标签泄漏与噪声:示例若标注错误或格式错乱,模型照错学错;若示例里无意混入了答案线索(标签泄漏),会掩盖模型真实能力。对策是人工校验示例质量、保持字段干净。
任务超出能力:需要私有知识、严格数学或多步硬推理时,加示例提升有限,应考虑检索增强或微调。
小结
少样本提示把少量「输入-输出」示例放进上下文,让模型通过上下文学习完成新任务,无需参数更新。其有效性可由 GPT-3 的元学习视角理解。编排时要关注示例的相关性、多样性与排序(近因效应),并保持格式一致、标签均衡。它介于零样本与微调之间:胜在快速零训练,弱在受上下文与分布偏移限制。面对推理模型,少样本边际收益下降,宜先试零样本。示例偏见、标签泄漏与任务超界是主要失败点,需以质量校验与均衡设计应对。
参考与延伸阅读
- Brown, T. 等. Language Models are Few-Shot Learners. arXiv:2005.14165, 2020. 提出 GPT-3 与上下文学习,少样本提示奠基论文。已核验。
- Xie, S. 等. An Explanation of In-context Learning as Implicit Bayesian Inference. arXiv:2111.02080, 2021. 上下文学习的贝叶斯推断解释。已核验。
- Wei, J. 等. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. arXiv:2201.02173, 2022. 思维链提示,可与少样本结合。已核验。
- Min, S. 等. Rethinking the Role of Demonstrations: What Makes In-Context Learning Work? arXiv:2202.12837, 2022. 研究示例标签正确性与顺序影响。已核验。
- Liu, J. 等. What Makes Good In-Context Examples for GPT-3? arXiv:2101.06804, 2021. 探讨示例选择与排序。已核验。