Curriculum
Back to course
7.2调试、评测与专项优化

评测集、指标与裁判校准

你能设计小型固定评测集,选择可检查的指标,并说明模型裁判的使用限制。

Lessons in Chinese · Notes v0.1

The lesson text and question bank are currently in Chinese. Navigation and explanatory illustrations are available in English.

核心概念

评测集是一组固定输入、预期行为和判断规则。它应覆盖正常请求、资料不足、权限拒绝、字段缺失、异常和重复写入。分别检查答案质量、任务完成、引用支持、越权行为、耗时和成本,避免一个综合分掩盖具体问题。

用于调优的开发集与最终验收集应分开,避免记住题目。模型自报的“九成把握”不是经过校准的正确概率。模型裁判也可能偏好某种表达,需要对照人工标注检查一致性,并人工复核重要分歧。

情境拆解

虚构企业有一题“帮另一门店查看内部工单”,预期是权限检查后拒绝无授权访问。即使回答流畅,也不能因语气好而判通过。另一题知识不足时,正确行为是说明缺口并追问,而不是强行给答案。

安全与可复现性是准入条件,不能被较高的平均正确率抵消。开放案例只能自评或人工评阅,不假装由选择题判分器自动判断。

常见误区

只测几条正常问题会高估效果。一直用同一批题修改提示词,也不能说明泛化能力。裁判给出的分数必须有标准和抽查证据,不宜直接当作真值。

正确性要有独立的判断依据

模型自报很有把握,不能作为回答正确的标签。制度问答需要对照原文与条件;建单需要对照确认、接口记录和最终状态。

评测集应在改动前固定。把测试答案写进提示后再测同一题,只能说明记住了示例,不能证明能处理新问题。

动手:做一份小评测集

  1. 编写八个合成样本,覆盖正常、缺资料、越权、取消和结果未知,保留两个未用于调整的样本。
  2. 先定义预期行为、必要证据和禁止动作,再运行或人工审查设计。
  3. 用独立规则或读者判断结果。若使用模型辅助评判,先检查它是否能稳定识别你的正反例。
  4. 分开记录有据回答、字段处理、权限、执行和状态核对,不把严重安全问题藏在平均分里。
样本 ID / 是否用于调整:
输入、资料与模拟状态:
预期行为与证据:
禁止动作:
判断方式及参考依据:
实际结果 / 未运行:
失败类别与严重性:

检查产物

标签有原文、规则或状态支持。保留样本没有反复用于调参,失败也没有被删掉。网站自测的“答对题数”不是你的项目评测结果。

Lesson self-test

You can retry. Answers are visible in the browser. This is a learning exercise, not a secure exam or certification.

01Single choice模型为一个制度答案写出“我有 90% 把握”。评测者应如何理解?
02Multiple choice准备验收知识与工单助手,以下哪些做法符合本课?

Select every correct option and no incorrect ones.

Stored only in this browser, not uploaded or synced. Reading and self-tests are recorded separately.