1/5
v2 · 第 0 步 · 10 分钟
训练前:这是行为问题还是事实问题
此步目标:写成功合同;让底模先答黄金集;决定 SFT 还是 RAG。
v2 开场
Instruct 模型已经会聊天。你要改的是哪一种错。
7B/8B Instruct 已经会问候、会写段落、会道歉。常见失败是:太长、不像你、表格飘、不该答的也答、把过期事实背进权重。微调教的是行为;百科和本周库存不该进 LoRA。
开训前做三件事:① 用一句话写失败(「客服总先客套再绕到重点」而不是「模型不够聪明」);② 写 12 道黄金题,含原句、改写、拒绝、一道必须查表的事实题;③ 用未加载 LoRA 的底模先答一遍,存档。这就是训练前。
点开看动画
互动 · 训前 / 训后
训练是为了修哪个失败,不是为了「跑完 1200 步」
底模已经会画人、会聊天。你花钱改的是一份补丁:让某一张脸稳定,或让某一种口吻稳定。没有训练前快照,训练后的「好像更好」只是感觉。
失败模式
底模会画「一个好看的人」,但换场景就换身份。IP-Adapter 每次都要再贴参考图,权重里没有「这个人」。
此刻出图
一张好看的亚洲女性,脸和训练集对不上。换 prompt 就换一张脸。
成功合同(开训前写上):6 条未见过的场景、同一 seed、关掉参考图,换装仍被认出;侧脸若数据里没有,允许失败,并记进下一轮补拍。
先拍照,再动刀:同一组 prompt / 同一组问题,底模答一遍存档。没有这组「前」,你无法证明补丁解决了问题,只能证明 loss 下降了。
别用错手段
提示词
- 零训练
- 临时人设
- 一长就忘
- 格式偶尔飘
RAG / 工具
- 最新制度、价格、库存
- 可追溯
- 不改性情
- 事实会过期时的唯一正解
SFT LoRA
- 口吻、表格、拒绝策略
- 要成对数据
- 会过拟合、会遗忘
- 本课主路径
测一下
「用我的语气回复客户,并引用本周库存」正确组合?
过关清单