Agent开发 · 文章
提示工程入门:零样本与少样本提示的全面解析
提示工程(Prompt Engineering)是一门较新的学科,关注提示词开发和优化,帮助用户将大语言模型(Large Language Model, LLM)用于各场景和研究领域。 掌握了提示工程相关技能将有助于用户更好地了解大型语言模型的能力和局限性。
研究人员可利用提示工程来提升大语言模型处理复杂任务场景的能力,如问答和算术推理能力。开发人员可通过提示工程设计、研发强大的工程技术,实现和大语言模型或其他生态工具的高效接轨。
提示工程不仅仅是关于设计和研发提示词。它包含了与大语言模型交互和研发的各种技能和技术。提示工程在实现和大语言模型交互、对接,以及理解大语言模型能力方面都起着重要作用。用户可以通过提示工程来提高大语言模型的安全性,也可以赋能大语言模型,比如借助专业领域知识和外部工具来增强大语言模型能力。
基于对大语言模型的浓厚兴趣,我们编写了这份全新的提示工程指南,介绍了大语言模型相关的论文研究、学习指南、模型、讲座、参考资料、大语言模型能力以及与其他与提示工程相关的工具。
摘自提示工程指南
零样本提示(Zero-Shot)
目前几乎所有AI模型提供商的大模型都是经过大量数据进行训练并调整指令的LLM,这样能够执行零样本任务。
所谓的零样本 ,就是在 不提供任何示例(样本) 的情况下,直接向大模型描述任务,让模型直接完成。这也是提示词工程中最常用的提示方式,没有了解过提示词工程的大多数大模型使用者,几乎都用到了这个零样本提示。
模型完全依靠它在预训练阶段学到的知识和对指令的理解来生成答案。
零样本提示的典型结构
[任务指令/角色设定]
[具体要求]
[输入内容]
我们看几个经典的实操例子:
1. 情感分类
请判断以下句子的情感倾向,只回答“正面”、“负面”或“中性”:
我今天特别开心,工作也顺利完成了!模型不需要你给它任何正负面的例子,就能直接回答“正面”。下面是这个提示词在DeepSeek中的实际使用效果。

2. 翻译
将以下英文翻译成简体中文,保持语气自然:
Grok is an AI built by xAI that aims to help humanity understand the universe.
3. 复杂任务
你是一位专业的法律顾问。请分析以下合同条款中可能存在的风险,并给出修改建议:
[合同条款内容]这个内容比较长,就不粘贴截图了。
零样本提示的一些局限和优势
优势:
简洁:提示短,token消耗相对小。
速度快:上下文简短,响应快速。
容易维护:不需要管理实例集。
泛化强:对新任务适应快。
局限:对于复杂推理、特定格式、边缘案例,效果往往不如Few-Shot
模型表现更依赖其本身的知识储备(小模型表现较差)
输出格式有时不够稳定
当零样本不起作用时,建议在提示中提供演示或示例,这就引出了少样本提示。
少样本提示(Few-Shot)
虽然目前大多数模型都展现了惊人的零样本能力,但是在前面也分析过,零样本以来训练时的数据量和训练情况,所以对于小模型来说,零样本提示得到的结果可能不会让人很满意。
与此同时,零样本更适合一些相对简单的任务,在复杂的任务上的表现仍然处于革命尚未成功的状态。如此,作为补充和增强,少样本提示,可以用来启用上下文学习,我们在提示中提供演示以引导模型实现更好的性能表现。
演示作为后续示例的条件,希望模型生成的响应。
Few-Shot Prompting 是指:在提示词中给出少量(通常2~8个)示例,让模型理解任务的输入-输出模式、风格、格式或推理方式,然后再让它处理新的输入。模型通过这些“示范”来快速学习,而不需要重新训练。
一些示例
1. 情感分类
请判断句子情感,只回答“正面”、“负面”或“中性”。
示例1:
句子:这部电影太棒了,我非常喜欢!
情感:正面
示例2:
句子:服务员态度很差,东西也难吃。
情感:负面
示例3:
句子:今天天气一般。
情感:中性
现在判断:
句子:我昨天买的手机出了问题,客服也不理我。
情感:
模型会根据前面的3个示例,正确回答“负面”。
2. 文本风格转换
请将以下正式文本改写成轻松幽默的风格。
示例1:
输入:我们公司决定延迟产品发布日期。
输出:哎呀,我们家产品要晚点跟大家见面啦,抱歉抱歉~
示例2:
输入:本次会议因故取消。
输出:会议突然黄了,大家可以回家睡大觉咯!
现在改写:
输入:用户投诉量上升,需要立即处理。
输出:
3. 结构化输出
从以下新闻中提取信息,并严格按照JSON格式输出。
示例1:
新闻:苹果公司于2025年发布新款iPhone,售价799美元。
输出:{"company": "苹果", "product": "iPhone", "year": 2025, "price": 799}
示例2:
新闻:OpenAI 在2026年推出了GPT-5模型。
输出:{"company": "OpenAI", "product": "GPT-5", "year": 2026, "price": null}
现在提取:
新闻:字节跳动2025年发布了新版本抖音国际版TikTok。
输出:
少样本提示的限制
标准的少样本提示对许多任务都有效,但仍然不是一种完美的技术,特别是在处理更复杂的推理任务时。
这就引出了下面即将提到的 思维链(CoT)提示提示技术,以解决更复杂的算术、常识和符号推理任务。
链式思考提示(CoT)
链式思考提示(Chain-of-Thought Prompting,简称 CoT) 是提示词工程中最重要、最有效的进阶技术之一,由 Google 在 2022 年的论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》提出。

CoT的核心实现是让模型一步步思考,而不是直接给出答案。通过在提示中展示或要求逐步推理过程,显著提升模型在复杂推理任务上的表现。
两种主要实现方式
1. Zero-Shot CoT(不需要示例)
请一步一步思考,然后给出最终答案。
问题:...2. Few-Shot CoT(推荐,更强)
给出几个带推理过程的完整示例,再让模型处理新问题。
一些示例
1. 常识推理
问题:如果我把一个西红柿放进冰箱,第二天拿出来,它更可能是熟了还是生了?请一步一步思考。
大致的思考过程:
1. 西红柿在常温下会继续成熟。
2. 冰箱低温会显著减缓成熟过程。
3. 所以第二天拿出来,它更可能是仍然生的。
答案:更可能是生的。

由于现在大模型的推理能力都已经很强了,所以上述的这个问题,DeepSeek给的推理过程也比较多,择日就截取了其中推理部分和结论。
2. 数学/逻辑题
小明有5个苹果,他给了小红3个,又买了4个,现在有多少个?一步一步思考。
3. 代码/编程
请一步一步思考如何用Python实现一个函数,判断一个数是否为质数。部分截图:



CoT的优势和限制
优势:
显著提升复杂任务性能:算术、逻辑、常识、多跳推理等,效果可提升 20%~50% 甚至更高。
适用于大模型:在 100B+ 参数的模型上效果最好(小模型可能“假思考”)。
无需微调:纯提示即可实现。
可解释性:模型输出中间步骤,便于用户检查错误。
可组合:能轻松与其他技术结合(Few-Shot + CoT 是黄金组合)。
限制:
增加 Token 消耗:推理过程会让提示和输出都变长,成本更高。
小模型效果差:模型太小可能产生幻觉式推理(看起来在思考,但逻辑错)。
不是万能:对极高难度或需要外部知识的任务仍可能失效。
有时过度思考:简单问题也会强行写很多步骤(可用“简洁思考”缓解)。
CoT 的本质是把“黑箱推理”变成“显式逐步推理”,极大释放了大语言模型的潜在推理能力。它是目前提示词工程中“性价比最高”的技术之一,几乎所有复杂任务都推荐优先尝试 Few-Shot CoT。
CoT模版

参考和学习
版权声明
本文内容版权归作者或相关权利人所有。转载、引用或其他使用请遵循相应授权条款,并保留本文链接。