无需显卡
模拟工位
v2 顺序:先定义失败,再打包成 Desktop 吃得下的那一个文件,再跑曲线、对照、请对考官。v1 的 caption 与账单仍在下面。
互动 · 训前 / 训后
训练是为了修哪个失败,不是为了「跑完 1200 步」
底模已经会画人、会聊天。你花钱改的是一份补丁:让某一张脸稳定,或让某一种口吻稳定。没有训练前快照,训练后的「好像更好」只是感觉。
失败模式
底模会画「一个好看的人」,但换场景就换身份。IP-Adapter 每次都要再贴参考图,权重里没有「这个人」。
此刻出图
一张好看的亚洲女性,脸和训练集对不上。换 prompt 就换一张脸。
成功合同(开训前写上):6 条未见过的场景、同一 seed、关掉参考图,换装仍被认出;侧脸若数据里没有,允许失败,并记进下一轮补拍。
互动 · 单文件打包
Desktop 本地上传只吃一个文件,怎么塞 24 张图?
先分清入口。Train 页 Dataset 虚线框是给文本 / VLM 的,官方格式是 PDF、DOCX、JSONL、JSON、CSV、Parquet,一次一个。人物扩散 LoRA 不该走这条门。
正确入口是 Images → Train的缩略图网格:多图导入、在表格里写 caption。不要把 24 张 PNG 拖进 Dataset 虚线框——那不是给 SDXL 人物用的。
若你的版本 Images 也开始收敛到单文件:把图和 caption 做成 Hugging Face ImageFolder(文件夹里放图 + metadata.jsonl),推到 Hub(可 private),再在 Desktop 的 Hub 搜索框加载。Hub 不受本地 dropzone 限制。
你的文件夹(示意)
Unsloth Dataset 拖放区
互动 · 概念动画
点一个词,看它动起来
专有名词不是要背的定义,是一套会动的机制。点开后可以再去原理册看长解释。
互动 · LoRA 补丁
底模冻结,只训练一条窄通道
大方块是底模权重,训练时不动。下面两块小矩阵才是 LoRA:左边把特征压窄,右边再展开。窄到什么程度,就是秩。
底模 W(冻结)
A 8×16 · B 16×8
ΔW ≈ B × A,参数量约 0.1M(示意)
能记住的细节
25%
背训练图的风险
0%
通道较窄:更像「记住一张脸」,不容易把某件衣服一起背下来。
互动 · Caption 实验室
按你看见的写,不要按你希望的写
三张示意训练卡。右侧是画面事实。试着写英文 caption,点评分看会不会把模型教歪。
正面半身,海军蓝外套,灰棚
仍是正面近景,黄雨衣,室外
持书半身,白衬衫,窗光
互动 · 训练模拟
看曲线,不看心情
这是按原文 1200 步、每 400 步存盘的示意曲线。后段轻微上翘,提醒你:最后一步可能已经开始背训练图。
0/1200 · loss 0.170
400 步
刚锁轮廓
800 步
原文目测最优
1200 步
可能开始背构图
互动 · 对照台
同一组场景,只换检查点
数字是示意外貌一致性,不是美颜分。原文在强度 0.8 下选了 800 步。第四、五张会故意不及格——数据里没有的,生成也补不出。
| 场景 | 底模 | 400 步 | 800 步 | 1200 步 |
|---|---|---|---|---|
黄雨衣 换装仍应认出同一张脸 | 32 | 54 | 78 | 74 |
深色礼服 妆造变了,眉眼要稳 | 28 | 50 | 82 | 76 |
雪地外套 背景最乱的一张 | 30 | 52 | 80 | 73 |
向左转脸 训练集缺侧脸,这里会露馅 | 22 | 36 | 48 | 44 |
半身 容易被画成更紧的近景 | 24 | 40 | 58 | 42 |
绿夹克公园 重新加载后的新图,不是训练图 | 34 | 55 | 84 | 70 |
若这是你的实验,你会带走哪一份?
互动 · 评测台
验完不等于测完。先选对考官。
ModelScope 家的工具叫 EvalScope,背后可挂 OpenCompass。它很强,但只在任务真的是知识、解题、考试时才该当主考官。口吻和人物身份请用黄金集。
要修的失败:像不像你说话、会不会按表格输出、会不会拒编事实。
- 12 道黄金题:原句、改写、拒绝、不该编的事实
- 底模先答一遍存档,训完同一张卷
- 可用另一模型按细则打分(LLM-as-Judge)
- 另抽 20 道 C-Eval / MMLU 看遗忘,不是主考官
主考官是黄金集。EvalScope 只做遗忘抽检。
互动 · 账单估算
开机就计费,关网页不算关机
原文 4090 约 2.08 元/小时,整轮 78 分钟含安装下载。拖动下面两条,看你的预算。
2.70 元
示意金额,不含账号充值门槛、下载失败重跑、忘关机过夜。定时关机是比任何优化器都便宜的超参。