课程目录
返回课程
7.3调试、评测与专项优化

Prompt与RAG专项优化

你能根据错误类型选择提示词或检索改动,并用固定条件判断是否真的改善。

中文讲义 · 讲义 v0.1

核心概念

Prompt 优化是调整任务说明、上下文组织和输出约束;RAG 优化是改善资料进入答案的过程,包括资料有效性、切分、检索和过滤。两者解决的原因不同,先定位问题再调整。

每次实验应保留基线,记录资料、模型、提示词与参数版本,尽量只改一类变量。开发集用于分析,独立验收集用于检查改动是否只适合已见题目;比较也要看耗时、成本和权限行为。

情境拆解

虚构企业的制度问答引用了旧版本,应先检查资料更新与有效期过滤。若检索已返回正确原文,但回答遗漏适用条件,可以检查提示词是否要求保留条件,并核对生成过程。

若资料根本没有答案,增加“必须回答”的指令会放大风险,应保留缺口说明。任何检索改动都不能绕过门店访问范围。

常见误区

提示词越长不一定越有效。一次同时换模型、切分和提示词,即使分数提高,也难以解释原因。对开发题逐句修补会造成过拟合;不能先看验收答案再反复调整。

一次只改一个有理由的变量

假设固定样本中,回答把“紧急报修”条件漏掉。先确定完整条件确实进入了上下文,再比较是否增加明确的条件保留要求;如果检索片段已丢条件,单改提示可能掩盖源头问题。

模型、提示、资料、切分和样本一起变化,无法判断是哪项改动带来改善。

动手:写一次对照实验

  1. 使用四份合成制度与六个固定问题,保留资料版本和权限范围。
  2. 运行基线,或在未具备环境时先记录设计预期,不声称有实测结论。
  3. 根据已确认错误,只改一项,例如版本过滤或条件提示。写清改动理由。
  4. 对比逐例结果、代价与新增问题,再用未参与调整的样本检查。
  5. 资料仍不支持时,预期行为仍是追问或说明未知,不是强制给答案。
实验 ID:
基线版本与固定样本:
已确认问题:
唯一改动及原因:
逐例结果:改善、不变或退化
额外调用、耗时与成本:
保留样本表现:
结论及尚不能推断的事情:

检查产物

结论的范围不超过样本与证据。“这几个例子改善”可以成立,“所有制度问题都已解决”则需要更多验证。

本课自测

用于检查理解,可以反复练习。答案在浏览器中可见,不作为正式考试或专业能力认证。

01单选开发集上发现旧制度被优先检索。怎样实验最有助于判断改动原因?
02多选检索已经返回正确制度原文,但答案遗漏适用条件。以下哪些处理符合本课?

多选题需选中全部正确选项,且不多选。

只保存在当前浏览器,不上传,不跨设备同步。阅读和自测分开记录。