文档
Skye Desk 使用手册
Skye Desk 能做什么、怎么用,从拍照片到使用做好的 LoRA 都在这里。每个功能都标有状态;只有当前版本已有的功能才附操作步骤。
01
入门
本章帮你在 Mac 上打开 Skye Desk,并介绍项目和工作区是什么。
下载与首次打开
第一个公开版本尚未发布;加入候补名单,发布时会收到一封邮件。发布后:
- 在下载页下载 Skye Desk。
- 把 Skye Desk 拖进“应用程序”文件夹。
- 打开它。如果 macOS 提示无法检查该 App,请打开“系统设置 › 隐私与安全性”。
- 滚动到“安全性”,点击 Skye Desk 旁边的“仍要打开”,然后确认。
- 之后 Skye Desk 就能正常打开了。
在版本获得 Apple 签名之前,macOS 会询问一次。面向 Apple silicon Mac;系统要求将随第一个版本一起确认;Intel Mac 尚未测试。
工作区与项目
工作区 是 Mac 上存放你所有项目的一个文件夹。一个 项目 对应一个主题,比如一件产品、一个角色或一种风格,包含它的图片、字幕和训练记录。所有内容都以普通文件的形式保存在那个文件夹里。
第一次完整走一遍
- 新建一个项目,给它一个触发词(自己编一个词,比如 prodshoot)。
- 把 15–30 张照片拖到 Dataset(数据集)页。
- 给每张图片写一条字幕,以触发词开头。
- 导出训练用 ZIP,或者在演示模式(模拟)下试跑一次。
- 用盲测对比样图。
02
准备图片
本章讲 LoRA 要学习的照片:怎么拍、怎么挑、怎么导入。
用手机拍摄
大多数人一开始并不需要 AI 生成的图片,给拍摄对象拍 20 到 30 张不错的手机照片就够了。
要拍多少张
| 产品、角色 | 15–30 |
| 服装 | 20–40 |
| 食物 | 15–25 |
| 风格 | 30 张或更多 |
| 真人(仅限本人同意) | 20–40 |
| 效果、材质、室内、包装 | 20–30 |
除了拍摄对象,其他都要变化
- 角度:正面、四分之三侧面、侧面、背面、俯视,再加几张特写。
- 背景:换 3–5 种。如果每张照片都是同一个背景,它会被当成拍摄对象的一部分学进去。
- 光线:窗边自然光、阴影处、台灯,不要全都一样。
- 距离:远景、中景和细节。
手机设置
- 用主摄 1× 拍,不要用超广角(它会让形状变形)。
- 关掉人像模式、滤镜和美颜。
- 点按屏幕对焦到拍摄对象;先把镜头擦干净。
- 保持最高分辨率;HEIC 格式没问题。
避免
- 其他品牌的 logo,以及任何你不想被学进去的文字。
- 手指挡住拍摄对象;反光表面里映出你自己。
- 几乎一样的照片。同一个位置拍十张,还不如三张不同的教得多。
按类型的小提示
- 产品
- 每拍一张就稍微转一下;拍到 logo 面、背面和底部;刻字或标签拍一张特写。
- 服装
- 用人台或衣架拍,再拍几张上身照(脸不入镜也可以);袖口、领子、纽扣和面料要拍近景。
- 角色 / 手办
- 正面、四分之三侧面、侧面、背面;脸部和各种花纹拍特写;光线保持一致。
- 食物
- 几分钟内拍完,趁它还没变样;俯拍、45° 和侧面;如果内部重要,切开拍一张。
- 室内
- 在视线高度拍墙角和正对的墙面;自然光和灯光都拍;避免有人走过。
- 风格
- 用同一种风格拍很多不同的对象,对象要变,风格不变。
- 真人
- 先取得书面同意。表情、光线和衣服要有变化;画面里不要有其他人。
传到 Mac 上
- 在 iPhone 上选中照片,用 AirDrop 分享到 Mac。
- 照片会出现在“下载”文件夹。
- 把它们拖到 Dataset(数据集)页。
App 内的拍摄清单(导入后显示还缺哪些照片)目前 计划中.
用已有的照片
从不同场合挑出拍摄对象的清晰照片;去掉模糊的、重滤镜的和截图。15–30 张好照片胜过 100 张相似的。
用 AI 生成图或参考图
你也可以用自己生成的图片建数据集,比如根据设计稿生成的图。逐张检查有没有走样,logo 或花纹变了也会被学进去。
不训练、直接使用参考图,这是 Reference Kit(参考图工作台)的功能: 计划中.
导入
如何导入图片? 现已可用
- 先准备同一主体的15到30张图片,角度各不相同。
- 点击“导入”,或拖入图片、文件夹或ZIP。
- 搜索文件名或字幕,找到任意图片。
- 打开数据集概览,发现缺口和失衡。
- 在右侧面板输入字幕(描述图片的文字)。
支持:PNG、JPG、WebP、BMP、HEIC 和 TIFF 图片,文件夹,ZIP 文件,以及同名的 TXT 或 JSON 字幕。iPhone 的 HEIC 照片可直接导入。
随处拖放或粘贴 下一个测试版推出
拖到网格、侧边栏中的项目、项目页面或首页,或用⌘V粘贴。按住⌥则移动而不是复制。复制前会先发现重复,导入也可以撤销。
当前版本尚未包含,推出前不提供操作步骤。
03
整理数据集
本章帮你把数据集整理好,让 LoRA 学到正确的东西。
按空格预览 现已可用
- 选中一张图片,按 Space.
- 用 ← 和 → 在图片之间切换。
- 按 Space 再按一次关闭。
标出缺失的字幕 现已可用
- 在网格里找到带标记的图片。
- 选择“缺少字幕”筛选,只看这些图片。
- 写字幕,或导入字幕。
像Finder一样好用的数据集 下一个测试版推出
按Return重命名,按⌘⌫移到废纸篓(可撤销),并使用与Finder相同的颜色标签。你在Finder里做的改动会立即显示。
当前版本尚未包含,推出前不提供操作步骤。
批量重命名 下一个测试版推出
选择一个命名规则,应用前先看到每个新名字。字幕也会一起改名,一次撤销即可恢复整批。
当前版本尚未包含,推出前不提供操作步骤。
数据集体检 下一个测试版推出
缺少触发词、尺寸太小无法训练、比例异常或与另一张几乎相同的图片都会被标出,每项旁边附有修复方法。近似重复可以用在你的Mac上运行的模型按内容查找(仅在你同意后下载);图片从不上传。
当前版本尚未包含,推出前不提供操作步骤。
从首页搜索所有项目 下一个测试版推出
按字幕、文件名或提示词搜索所有项目。每个项目都会显示下一步。
当前版本尚未包含,推出前不提供操作步骤。
04
写字幕
本章说明字幕该写什么、不该写什么。
想让 LoRA 学会的东西不要写;希望以后能随意改变的东西才写。 每条字幕都以触发词开头。
各类型的字幕技巧
- 角色
- 要写: 姿势、视角(正面、侧面)、背景、光线、站在什么上面。
不写: 角色本身的外观——体形、颜色、面部、斑纹——让触发词来承载这些。 - 产品
- 要写: 角度、背景、台面、光线、旁边的道具。
不写: 产品的形状、logo区域、图案和材质。 - 服装
- 要写: 展示方式(人台、衣架、平铺)、角度、背景。
不写: 版型、面料、缝线、纽扣、颜色。 - 风格
- 要写: 每张图片的主体(一棵树、一座房子、一条船)。
不写: 风格本身——纸张层次、柔和阴影、白上加白。 - 特效
- 要写: 底下的物体(一颗松果、一把钥匙)及其场景。
不写: 特效本身——霜晶、发光、磨损。 - 材质
- 要写: 材质被做成了什么形状,以及如何打光。
不写: 材质的纹理和颜色。 - 室内
- 要写: 房间布局、家具、机位、时间段。
不写: 墙面、地面、配色、光线质感。 - 食物
- 要写: 盘子、桌子、角度、是否切开。
不写: 菜品本身——酥皮、水果摆法、颜色。 - 包装
- 要写: 周围有什么、台面、角度、光线。
不写: 瓶子或盒子的形状、标签区域、瓶盖和颜色。
触发词
一个自己编的短词,用来唤出你的拍摄对象,比如 prodshoot。每条字幕里的写法要一致。
触发词拼写检查 下一个测试版推出
触发词(用来召唤你的主体的词)的不同拼法会被找出来,一步修正。
当前版本尚未包含,推出前不提供操作步骤。
如何批量修改字幕? 现已可用
- 打开Caption 工具 › 查找与替换。
- 输入要查找的词。
- 输入要替换成的内容。
- 点击“预览”,逐行查看修改前后。
- 点击“应用”。撤销可恢复整批。
查看标签分布 现已可用
- 打开 Dataset overview(数据集概览)。
- 查看每个标签占图片的比例。
- 点击标签查看对应图片,修正偏向某一边的字幕。
如何从我自己的AI获取字幕? 现已可用
- 导出所有图片,然后让任意AI为每张图片写一个.txt。
- 选择“导入 › 导入字幕包”,然后选取文件。
- 确认“写入到”显示的是正确的项目。
- 检查各行:MATCH会被写入,SKIP不会。
- 点击“写入字幕”。
整个数据集的标签面板 下一个测试版推出
查看每个标签及其使用次数,然后在多张图片上批量添加、删除或重命名,可撤销。
当前版本尚未包含,推出前不提供操作步骤。
逐条检查AI生成的字幕 下一个测试版推出
新旧字幕并排对比,只保留你勾选的。导入前会先备份。
当前版本尚未包含,推出前不提供操作步骤。
05
训练
本章把数据集变成 LoRA,并说明目前哪些是真实运行、哪些是模拟。
当前版本的训练在演示模式(模拟)下运行:不会租用 GPU,也不会产生任何费用。
如何导出训练ZIP? 现已可用
- 给每张图片写上字幕;空字幕会阻止导出。
- 打开“文件”菜单。
- 选择“导出训练包”,或按 ⌘⇧E.
- 解压:01.png与01.txt放在一起。
- 用kohya(另一款训练工具)训练?按kohya的要求,把文件放进一个以重复次数命名的额外文件夹。
演示模式
如何开始一次训练? 现已可用
- 设置步数(学习多少轮)。
- 选择云GPU——在网上租用的高性能计算机。
- 查看时间和费用预估。
- 点击“开始训练”。在本测试版中,训练是模拟的,不产生任何费用。
训练预设与检查清单 下一个测试版推出
选择LoRA类型即可获得现成设置,并在每次训练前提供检查清单。清单给的是建议,不是评分。
当前版本尚未包含,推出前不提供操作步骤。
一键在RunPod上训练 测试期间推出
选择最便宜或最快;Skye Desk挑选可用的GPU,并在租用前显示预估。
当前版本尚未包含,推出前不提供操作步骤。
花费上限与自动停止 测试期间推出
为每次训练设定上限。训练结束、闲置或达到上限时,GPU自动停止。
当前版本尚未包含,推出前不提供操作步骤。
从中断处继续 测试期间推出
如果发生这种情况,训练会在新的GPU上从最近保存的步数继续。
当前版本尚未包含,推出前不提供操作步骤。
连接 Runpod
在 Runpod 上真实训练目前 测试期间推出。你需要一个有余额的 Runpod 账号和一个 API key,粘贴到 Connections(连接)页。
简单模式与高级模式
简单模式只问类型、底模和预算;高级模式显示每一项设置并附说明。 计划中
使用参考图
参考图工作台(Reference Kit):用参考图代替训练 计划中
从设定图构建参考图集,检查后用于支持参考图的图像工具——或者让Skye Desk对比两种方式并给出建议。
当前版本尚未包含,推出前不提供操作步骤。
创作者模式
创作者模式 计划中
围绕角色及其系列打造的更简单的工作区,适合博主、AI网红和短视频创作者。
当前版本尚未包含,推出前不提供操作步骤。
06
生成与对比
本章用你的 LoRA 生成新图片,并帮你留下最好的版本。
如何导回ComfyUI结果? 现已可用
- 选择一个图片编号。
- 写下它的提示词和反向提示词。
- 复制工作流,在ComfyUI中运行。
- 按图片编号为每个结果命名,然后导入。
如何对比检查点? 现已可用
- 从某次训练的样图中打开盲测。
- 从每组A/B中选出更好的一张。
- 点击“到此为止并查看结果”查看排名。
- 点错了?撤销上一票。
对比训练并设定最终LoRA 下一个测试版推出
在项目页面并排对比两次训练,把其中一个标为最终LoRA,并显示其底模。
当前版本尚未包含,推出前不提供操作步骤。
从图片中找出工作流 下一个测试版推出
Skye Desk读取图片中保存的ComfyUI工作流,并按底模(你的LoRA所依附的AI模型)分组。
当前版本尚未包含,推出前不提供操作步骤。
把提示词用作字幕草稿 下一个测试版推出
把图片中保存的提示词插入字幕,再进行编辑。
当前版本尚未包含,推出前不提供操作步骤。
把提示词发送到ComfyUI 测试期间推出
一次把所有图片编号发送到ComfyUI,并自动填入各自的提示词。
当前版本尚未包含,推出前不提供操作步骤。
检查每张结果是否走样 计划中
每张新图都会与你的主体对比;走样、出现多余文字或logo的图片会被标出,由你决定保留或舍弃。
当前版本尚未包含,推出前不提供操作步骤。
工作流页面:拖入图片即可找到其工作流 计划中
把图片、JSON文件或ZIP拖到工作流页面;每个工作流都会被识别、命名,并与你已有的工作流对比。
当前版本尚未包含,推出前不提供操作步骤。
07
导出并使用 LoRA
本章讲做好的 LoRA 存在哪里、怎么使用。
目前你需要用自己的工具(AI Toolkit 或 OneTrainer)从训练 ZIP 进行训练;LoRA 文件(.safetensors)会出现在该工具的输出文件夹里。
- 把 .safetensors 文件复制到 ComfyUI/models/loras。
- 在 ComfyUI 里,在模型加载器之后添加一个 Load LoRA 节点。
- 选择你的文件,强度先从 0.7–1.0 开始。
- 把触发词放在提示词的开头。
各底模的许可不同,有些不允许把生成结果用于商业用途。出售或发布之前,请先查看底模的许可条款。
对比训练并设定最终LoRA 下一个测试版推出
在项目页面并排对比两次训练,把其中一个标为最终LoRA,并显示其底模。
当前版本尚未包含,推出前不提供操作步骤。
08
文件安全
本章说明你的文件在哪里,以及改动如何撤销。
- 图片和字幕都是工作区文件夹里的普通文件;字幕以 .txt 文件的形式放在图片旁边。
- 批量修改会先显示预览,并且可以整体撤销。
- 像备份其他文件夹一样备份工作区文件夹(用 Time Machine 就可以)。
09
隐私与授权
本章讲哪些内容会离开你的 Mac,以及哪些人的照片可以用来训练。
- 你的图片留在自己的 Mac 上。除非你启动云端训练,否则不会上传任何内容。
- 只有取得本人书面同意才能用真人照片训练,未成年人一律不行。
- 未经许可,不要用他人受版权保护的作品或肖像来训练。
10
参考
快捷键、术语和常见问题,都在这里。
键盘快捷键
- ⌘1–⌘8 依次打开侧边栏各页面(从上到下)。
- ⌘K 查找任意页面、操作或项目。
- Space 预览所选图片; ← 和 → 在图片间切换。
- ⌘, 打开设置; ⌘⇧F 打开字幕查找与替换。
术语表
- LoRA
- 一个小型附加文件,教AI图像模型认识一个主体,比如你的角色、产品或风格。
- 字幕
- 描述一张图片的文字。AI会同时从图片和字幕中学习。
- 标签
- 字幕中的短语,比如“front view”或“white studio background”。
- 触发词
- 一个自造的词,比如wren,在生成新图片时用来召唤你的主体。
- 底模
- 你的LoRA所依附的AI图像模型。LoRA只能用于训练时所用的底模系列。
- 检查点
- 训练过程中保存的LoRA副本。对比检查点可以看出哪一步效果最好。
- 云GPU
- 在网上按小时租用、用来运行训练的高性能计算机。
- ComfyUI
- 一款用AI模型生成图片的免费应用。Skye Desk规划提示词,ComfyUI负责出图。
- AI Toolkit, OneTrainer
- 免费的训练程序。Skye Desk为它们准备所需的文件。
常见问题
- macOS 提示无法检查该 App
- 系统设置 › 隐私与安全性 › 仍要打开(见第 01 章)。
- 无法导出
- 每张图片都需要字幕;用“缺少字幕”筛选找出来。
- 导入的字幕没有对上
- 字幕文件必须和图片同名(01.png ↔ 01.txt)。
- LoRA 把背景也学进去了
- 换 3–5 种不同的背景重拍,或者在每条字幕里描述背景。
没有找到,换个词试试。