第 3 章
写标注
每张照片配一条标注,用一句话说明图里有什么。这一章讲该写什么、不该写什么,以及一次处理很多张的工具。
标注怎么写
每张照片一句话,用触发词开头。
写每张图之间会变的东西;想让 LoRA 学会的,就别写。

- 选中一张照片,在右边的框里写标注。离开输入框会自动保存,也可以按 ⌘S.
- 每条标注都用触发词开头;你一边打字,它一边高亮。
- 写短一点。标注太长时,输入框上方的字数和 token 数会变黄。
拼一条标注
姿势
背景
光线
角度
vell_trench, standing, plain grey wall, soft window light, front view
要写 每张照片之间变化的东西:姿势、地点、光线、角度。
不要写 LoRA 应该学会的东西:camel colourdouble-breastedbelted waiststorm flap
在所有标注中替换一个词
一次改掉所有标注里的同一句话。

- 点数据集工具栏上的「查找/替换」。
- 输入要查找的词,和要换成什么。
- 看一下预览:每条会被改到的标注都列出来了。
- 点「应用」。按 ⌘Z 能把整批改动一次撤销。
触发词工具
让触发词在每条标注里都写得一模一样。

- 点左边的「触发词问题」,看哪些标注缺了触发词或拼法不一样。
- 点「查找/替换」,打开「触发词」页。
- 选「从…改名」,填上旧拼法(vel_trench),确认触发词一栏是 vell_trench。
- 看预览:每条标注改动前后的样子。只有和旧拼法一样(不分大小写)、用逗号隔开的整项才会改。改完如果一条标注里有重复的触发词,只留第一个。
- 点「应用」。按 ⌘Z 能把整批改动一次撤销。
「触发词」页的其他功能
- 「缺少时添加」会在没有触发词的标注开头加上它,不会改正拼错的词。
- 「移到开头」把触发词挪到每条标注的最前面;「删除」把它去掉。
用「查找与替换」
「查找与替换」对任何文字都管用。在它的页里查找拼错的词(vel_trench),替换成你的触发词(vell_trench),勾选「全词匹配」,看一下预览再点「应用」。
试一试
vell, trench coat, studio light, plain backgroundVell, trench coat on a rainy street at nightvel, trench coat, close-up of the collar
1 / 3 条标注完全一致 · 2 条写法不一样
标签和比例
看看哪些词在标注里占了太多。

- 打开网格下方的「标签」。条形图显示每个词出现在多少比例的标注里。
- 点一个词,就能看到用了它的照片。
- 右键可以给词改名或删除;打开「All…」能把几个词合并成一个。
- 拖动词语可以调整顺序;触发词永远排第一。
如果大多数标注里都有同一个背景或姿势,LoRA 也会把它学进去。改写这些标注,或者多拍一些不一样的。
一次写很多条标注
给一组照片加上同样的词。

- 选中这些照片。
- 点「查找/替换」打开批量标注工具,输入要加上或要改的词。
- 看一眼预览,确认后应用。按 ⌘Z 可以撤销。
之后推出
- 在你的 Mac 上用 AI 先写好标注草稿。
- 导入别的 AI 写好的标注。
- 一条条审阅新写的标注。
Mac 上的本地 AI 模型
在你的 Mac 上写标注初稿、打标签、抠遮罩的小型 AI 模型,照片不用上传。
之后推出
这一篇的功能首个测试版还没有,之后推出。可以先据此预留硬盘空间、查看许可证。
有哪些模型
Skye Desk 先提供一组小模型:加上运行它们的 Python(约 1.5 GB),一共约 3.6 GB。
| 模型 | 下载大小 | 许可证 | 商用 |
|---|---|---|---|
| Florence-2-large-PromptGen v2.0用句子或标签写标注初稿;为遮罩找出衣服、脸或头发 | 约 1.6 GB | MIT | 能 |
| WD vit tagger v3给 SDXL 项目打逗号分隔的标签 | 约 0.4 GB | Apache-2.0 | 能 |
| SAM 2.1 tiny生成遮罩 | 约 0.2 GB | Apache-2.0 | 能 |
更大的模型也列在这里,硬盘够时可以用:
| 模型 | 下载大小 | 许可证 | 商用 |
|---|---|---|---|
| JoyCaption Beta One写标注初稿 | 约 16.5 GB | Llama 3.1 Community License | 有条件 |
| Qwen2.5-VL-7B-Instruct写标注初稿 | 约 16.6 GB | Apache-2.0 | 能 |
| Qwen3-VL-4B-Instruct写标注初稿 | 约 8.9 GB | Apache-2.0 | 能 |
| Florence-2-large为遮罩找出部位 | 约 1.5 GB | MIT | 能 |
| WD eva02-large tagger v3标签 | 约 1.2 GB | Apache-2.0 | 能 |
| BiRefNet整个主体的遮罩 | 约 0.9 GB | MIT | 能 |
| SAM 2.1 base+生成遮罩 | 约 0.3 GB | Apache-2.0 | 能 |
JoyCaption 遵循 Llama 3.1 Community License,有附加条件(署名、命名、使用政策),用之前先读许可证原文。许可证不允许商用的模型,比如 RMBG-2.0、Qwen2.5-VL-3B 以及衣服和人脸分割模型,不提供下载。
下载和删除
- 你确认之前什么都不会下载。Skye Desk 会先列出每个模型的名字、大小和许可证,以及下载后还剩多少空间。
- 模型从 Hugging Face 下载。下载可以暂停再继续,每个文件用之前都会先校验。
- 模型放在单独的文件夹 ~/Skye Desk/models,在工作区之外,用的是自己的 Python:Mac 上别的东西都不会变。
- 要腾出空间,先退出 Skye Desk,再删掉那里对应模型的文件夹。
哪些功能要用到
- 数据集工具栏上的「自动标注」会给你选的照片写标注初稿。初稿只是预览:点「应用」之前不会写进你的标注,⌘Z 能撤销整批。
- 「遮罩」会把衣服、脸或头发抠出来,让训练时集中学这些部分。整个主体的遮罩需要更大那组里的 BiRefNet。
- 没有这些模型,其他功能照常能用,标注由你自己写。
不同类型怎么写标注
服装、角色、发型、商品和风格,各自该怎么写。
- 服装
my_coat, a trench coat on a dress form, side view, plain grey background要写: 姿势、穿它的人或人台、背景、光线、拍摄角度。
不写: 你希望风衣保持不变的面料、颜色、版型和细节。这些要交给 LoRA 去学。
- 角色
my_char, sitting on a bench, three-quarter view, soft evening light, city street要写: 角色在做什么、什么姿势、衣服(如果要换的话)、在哪里、什么光线。
不写: 让这个角色成为他自己的脸、发型、配色和标记。
- 发型
my_hair, woman seen from the side, indoor window light, plain wall要写: 谁的头发、什么角度、什么光线、背景、穿的衣服。
不写: 头发本身的发型、长度、颜色和质感。
- 商品
my_bottle, on a stone plinth, top view, morning light, soft shadow要写: 它放在哪里、什么角度、什么光线、旁边的道具和背景。
不写: 形状、标签、颜色和 logo,这些必须保持不变的部分。
- 风格
my_style, a lighthouse on a cliff, wide view要写: 每张图里画的是什么,每张都应该不一样。
不写: 它的样子:笔触、配色、线条。这些正是 LoRA 要学的。