1/5

v2 · 0 步 · 10 分钟

训练前:这是行为问题还是事实问题

此步目标:写成功合同;让底模先答黄金集;决定 SFT 还是 RAG。

v2 开场

Instruct 模型已经会聊天。你要改的是哪一种错。

7B/8B Instruct 已经会问候、会写段落、会道歉。常见失败是:太长、不像你、表格飘、不该答的也答、把过期事实背进权重。微调教的是行为;百科和本周库存不该进 LoRA。

开训前做三件事:① 用一句话写失败(「客服总先客套再绕到重点」而不是「模型不够聪明」);② 写 12 道黄金题,含原句、改写、拒绝、一道必须查表的事实题;③ 用未加载 LoRA 的底模先答一遍,存档。这就是训练前。

点开看动画

互动 · 训前 / 训后

训练是为了修哪个失败,不是为了「跑完 1200 步」

底模已经会画人、会聊天。你花钱改的是一份补丁:让某一张脸稳定,或让某一种口吻稳定。没有训练前快照,训练后的「好像更好」只是感觉。

失败模式

底模会画「一个好看的人」,但换场景就换身份。IP-Adapter 每次都要再贴参考图,权重里没有「这个人」。

此刻出图

一张好看的亚洲女性,脸和训练集对不上。换 prompt 就换一张脸。

成功合同(开训前写上):6 条未见过的场景、同一 seed、关掉参考图,换装仍被认出;侧脸若数据里没有,允许失败,并记进下一轮补拍。

先拍照,再动刀:同一组 prompt / 同一组问题,底模答一遍存档。没有这组「前」,你无法证明补丁解决了问题,只能证明 loss 下降了。

别用错手段

提示词

  • 零训练
  • 临时人设
  • 一长就忘
  • 格式偶尔飘

RAG / 工具

  • 最新制度、价格、库存
  • 可追溯
  • 不改性情
  • 事实会过期时的唯一正解

SFT LoRA

  • 口吻、表格、拒绝策略
  • 要成对数据
  • 会过拟合、会遗忘
  • 本课主路径

测一下

「用我的语气回复客户,并引用本周库存」正确组合?

过关清单