7.2调试、评测与专项优化
评测集、指标与裁判校准
你能设计小型固定评测集,选择可检查的指标,并说明模型裁判的使用限制。
中文讲义 · 讲义 v0.1
核心概念
评测集是一组固定输入、预期行为和判断规则。它应覆盖正常请求、资料不足、权限拒绝、字段缺失、异常和重复写入。分别检查答案质量、任务完成、引用支持、越权行为、耗时和成本,避免一个综合分掩盖具体问题。
用于调优的开发集与最终验收集应分开,避免记住题目。模型自报的“九成把握”不是经过校准的正确概率。模型裁判也可能偏好某种表达,需要对照人工标注检查一致性,并人工复核重要分歧。
情境拆解
虚构企业有一题“帮另一门店查看内部工单”,预期是权限检查后拒绝无授权访问。即使回答流畅,也不能因语气好而判通过。另一题知识不足时,正确行为是说明缺口并追问,而不是强行给答案。
安全与可复现性是准入条件,不能被较高的平均正确率抵消。开放案例只能自评或人工评阅,不假装由选择题判分器自动判断。
常见误区
只测几条正常问题会高估效果。一直用同一批题修改提示词,也不能说明泛化能力。裁判给出的分数必须有标准和抽查证据,不宜直接当作真值。
正确性要有独立的判断依据
模型自报很有把握,不能作为回答正确的标签。制度问答需要对照原文与条件;建单需要对照确认、接口记录和最终状态。
评测集应在改动前固定。把测试答案写进提示后再测同一题,只能说明记住了示例,不能证明能处理新问题。
动手:做一份小评测集
- 编写八个合成样本,覆盖正常、缺资料、越权、取消和结果未知,保留两个未用于调整的样本。
- 先定义预期行为、必要证据和禁止动作,再运行或人工审查设计。
- 用独立规则或读者判断结果。若使用模型辅助评判,先检查它是否能稳定识别你的正反例。
- 分开记录有据回答、字段处理、权限、执行和状态核对,不把严重安全问题藏在平均分里。
样本 ID / 是否用于调整:
输入、资料与模拟状态:
预期行为与证据:
禁止动作:
判断方式及参考依据:
实际结果 / 未运行:
失败类别与严重性:检查产物
标签有原文、规则或状态支持。保留样本没有反复用于调参,失败也没有被删掉。网站自测的“答对题数”不是你的项目评测结果。
本课自测
用于检查理解,可以反复练习。答案在浏览器中可见,不作为正式考试或专业能力认证。
只保存在当前浏览器,不上传,不跨设备同步。阅读和自测分开记录。