语言模型与能力边界
你能解释模型输出为什么需要核验,并为知识、计算和业务动作选择可靠的结果来源。
Lessons in Chinese · Notes v0.1
The lesson text and question bank are currently in Chinese. Navigation and explanatory illustrations are available in English.
核心概念
大语言模型基于训练形成的规律和当前输入生成输出。Token 是处理内容的计量单位,不等同于一个汉字;上下文窗口限制一次调用可处理的内容,但放得进去不保证模型一定正确使用每项信息。
幻觉表现为没有可靠依据却输出看似合理的内容。回答流畅、语气肯定,甚至模型自报“很有把握”,都不能单独证明答案正确。外部检索与工具可以提供证据,但系统仍要检查来源、适用范围和执行结果。
情境拆解
在虚构企业的制度助手中,“这项补贴现在是多少”需要有效制度;“这批工单总数”应由查询或确定性代码统计;“工单已经提交”需要接口状态。模型可以解释这些结果,但不能代替资料、计算或系统记录。
常见误区
换更强模型可能改善部分任务,却不能修复缺资料、权限错误或失效接口。把整套制度塞进上下文,也不等于已经建立可靠的知识服务。
先判断结果从哪里来
下面是同一个模拟助手的三项请求:
| 请求 | 模型可以做什么 | 谁提供可靠结果 |
|---|---|---|
| “补贴标准现在是多少?” | 理解问题、组织解释 | 适用于该员工的有效制度 |
| “这批工单一共花了多少钱?” | 说明统计口径 | 授权记录与确定性计算 |
| “刚才提交成功了吗?” | 根据状态组织反馈 | 业务接口的回执或状态查询 |
找不到当前制度时,答案应该保留为未知;不能用训练时见过的相似政策补齐。接口超时后,换一个模型再问一次也不会让业务状态更清楚。
动手:做一张结果来源表
- 沿用第 1 课的项目卡,增加制度咨询、金额统计、建单、状态查询和工单摘要五类请求。
- 每类写出需要的输入、模型的职责、可靠来源和验证方式。
- 删去资料或接口结果,写出此时应该给用户的反馈。反馈要说明缺什么、下一步怎样核对,不猜测未知结果。
- 挑出一句带数字或“已完成”的回复,逐项找对应证据。
请求:
模型负责:
可靠结果来源及版本:
核对方法:
证据缺失时的回复:
不允许模型代替的判断:检查产物
每个事实、数字和完成声明,都能指向资料、计算过程或系统状态。仅写“让另一个模型审核”不够:审核者仍需要同一份可靠证据。用本课自测检查自己是否把生成文字与验证结果分开。
Lesson self-test
You can retry. Answers are visible in the browser. This is a learning exercise, not a secure exam or certification.
Stored only in this browser, not uploaded or synced. Reading and self-tests are recorded separately.