GPT-3 证明,扩大模型与训练规模后,许多任务可以直接通过自然语言说明和少量示例完成,无需为每项任务单独微调。
发生了什么
2020 年,OpenAI 发布 GPT-3 研究成果。该模型拥有 1750 亿参数,并重点展示了“少样本学习”:用户只需在提示中给出任务说明或少量示例,模型就能尝试完成翻译、问答、填空和简单推理等不同任务,而不必针对每个任务重新训练参数。
为什么它重要
在 GPT-3 之前,许多自然语言系统仍高度依赖专门的数据集和任务微调。GPT-3 让行业看到另一条路线:同一个基础模型可以把自然语言当作统一接口,通过上下文临时理解任务。这一变化为后来的提示工程、通用 API 和对话式产品奠定了产品逻辑。
能力与限制应同时看
GPT-3 的论文也明确展示了局限,包括部分推理任务表现不稳定、训练数据带来的偏差,以及生成内容可能难以与人类写作区分等问题。它的里程碑意义不是“模型已经理解一切”,而是证明了规模化预训练能够产生更通用的任务适应能力。
从 GPT-3 开始,AI 产品逐渐从“一个模型解决一个任务”走向“一个模型通过语言接收多种任务”。
资料来源
内容版权归 SOSBEI 所有
