文档

Skye Desk 使用手册

Skye Desk 能做什么、怎么用,从拍照片到使用做好的 LoRA 都在这里。每个功能都标有状态;只有当前版本已有的功能才附操作步骤。

01

入门

本章帮你在 Mac 上打开 Skye Desk,并介绍项目和工作区是什么。

下载与首次打开

第一个公开版本尚未发布;加入候补名单,发布时会收到一封邮件。发布后:

  1. 在下载页下载 Skye Desk。
  2. 把 Skye Desk 拖进“应用程序”文件夹。
  3. 打开它。如果 macOS 提示无法检查该 App,请打开“系统设置 › 隐私与安全性”。
  4. 滚动到“安全性”,点击 Skye Desk 旁边的“仍要打开”,然后确认。
  5. 之后 Skye Desk 就能正常打开了。

在版本获得 Apple 签名之前,macOS 会询问一次。面向 Apple silicon Mac;系统要求将随第一个版本一起确认;Intel Mac 尚未测试。

工作区与项目

工作区 是 Mac 上存放你所有项目的一个文件夹。一个 项目 对应一个主题,比如一件产品、一个角色或一种风格,包含它的图片、字幕和训练记录。所有内容都以普通文件的形式保存在那个文件夹里。

第一次完整走一遍

  1. 新建一个项目,给它一个触发词(自己编一个词,比如 prodshoot)。
  2. 把 15–30 张照片拖到 Dataset(数据集)页。
  3. 给每张图片写一条字幕,以触发词开头。
  4. 导出训练用 ZIP,或者在演示模式(模拟)下试跑一次。
  5. 用盲测对比样图。

02

准备图片

本章讲 LoRA 要学习的照片:怎么拍、怎么挑、怎么导入。

用手机拍摄

大多数人一开始并不需要 AI 生成的图片,给拍摄对象拍 20 到 30 张不错的手机照片就够了。

要拍多少张

产品、角色15–30
服装20–40
食物15–25
风格30 张或更多
真人(仅限本人同意)20–40
效果、材质、室内、包装20–30

除了拍摄对象,其他都要变化

  • 角度:正面、四分之三侧面、侧面、背面、俯视,再加几张特写。
  • 背景:换 3–5 种。如果每张照片都是同一个背景,它会被当成拍摄对象的一部分学进去。
  • 光线:窗边自然光、阴影处、台灯,不要全都一样。
  • 距离:远景、中景和细节。

手机设置

  • 用主摄 1× 拍,不要用超广角(它会让形状变形)。
  • 关掉人像模式、滤镜和美颜。
  • 点按屏幕对焦到拍摄对象;先把镜头擦干净。
  • 保持最高分辨率;HEIC 格式没问题。

避免

  • 其他品牌的 logo,以及任何你不想被学进去的文字。
  • 手指挡住拍摄对象;反光表面里映出你自己。
  • 几乎一样的照片。同一个位置拍十张,还不如三张不同的教得多。

按类型的小提示

产品
每拍一张就稍微转一下;拍到 logo 面、背面和底部;刻字或标签拍一张特写。
服装
用人台或衣架拍,再拍几张上身照(脸不入镜也可以);袖口、领子、纽扣和面料要拍近景。
角色 / 手办
正面、四分之三侧面、侧面、背面;脸部和各种花纹拍特写;光线保持一致。
食物
几分钟内拍完,趁它还没变样;俯拍、45° 和侧面;如果内部重要,切开拍一张。
室内
在视线高度拍墙角和正对的墙面;自然光和灯光都拍;避免有人走过。
风格
用同一种风格拍很多不同的对象,对象要变,风格不变。
真人
先取得书面同意。表情、光线和衣服要有变化;画面里不要有其他人。

传到 Mac 上

  1. 在 iPhone 上选中照片,用 AirDrop 分享到 Mac。
  2. 照片会出现在“下载”文件夹。
  3. 把它们拖到 Dataset(数据集)页。

App 内的拍摄清单(导入后显示还缺哪些照片)目前 计划中.

用已有的照片

从不同场合挑出拍摄对象的清晰照片;去掉模糊的、重滤镜的和截图。15–30 张好照片胜过 100 张相似的。

用 AI 生成图或参考图

你也可以用自己生成的图片建数据集,比如根据设计稿生成的图。逐张检查有没有走样,logo 或花纹变了也会被学进去。

不训练、直接使用参考图,这是 Reference Kit(参考图工作台)的功能: 计划中.

导入

如何导入图片? 现已可用

  1. 先准备同一主体的15到30张图片,角度各不相同。
  2. 点击“导入”,或拖入图片、文件夹或ZIP。
  3. 搜索文件名或字幕,找到任意图片。
  4. 打开数据集概览,发现缺口和失衡。
  5. 在右侧面板输入字幕(描述图片的文字)。

支持:PNG、JPG、WebP、BMP、HEIC 和 TIFF 图片,文件夹,ZIP 文件,以及同名的 TXT 或 JSON 字幕。iPhone 的 HEIC 照片可直接导入。

随处拖放或粘贴 下一个测试版推出

拖到网格、侧边栏中的项目、项目页面或首页,或用⌘V粘贴。按住⌥则移动而不是复制。复制前会先发现重复,导入也可以撤销。

当前版本尚未包含,推出前不提供操作步骤。

03

整理数据集

本章帮你把数据集整理好,让 LoRA 学到正确的东西。

按空格预览 现已可用

  1. 选中一张图片,按 Space.
  2. 用 ← 和 → 在图片之间切换。
  3. 按 Space 再按一次关闭。

标出缺失的字幕 现已可用

  1. 在网格里找到带标记的图片。
  2. 选择“缺少字幕”筛选,只看这些图片。
  3. 写字幕,或导入字幕。

像Finder一样好用的数据集 下一个测试版推出

按Return重命名,按⌘⌫移到废纸篓(可撤销),并使用与Finder相同的颜色标签。你在Finder里做的改动会立即显示。

当前版本尚未包含,推出前不提供操作步骤。

批量重命名 下一个测试版推出

选择一个命名规则,应用前先看到每个新名字。字幕也会一起改名,一次撤销即可恢复整批。

当前版本尚未包含,推出前不提供操作步骤。

数据集体检 下一个测试版推出

缺少触发词、尺寸太小无法训练、比例异常或与另一张几乎相同的图片都会被标出,每项旁边附有修复方法。近似重复可以用在你的Mac上运行的模型按内容查找(仅在你同意后下载);图片从不上传。

当前版本尚未包含,推出前不提供操作步骤。

从首页搜索所有项目 下一个测试版推出

按字幕、文件名或提示词搜索所有项目。每个项目都会显示下一步。

当前版本尚未包含,推出前不提供操作步骤。

04

写字幕

本章说明字幕该写什么、不该写什么。

想让 LoRA 学会的东西不要写;希望以后能随意改变的东西才写。 每条字幕都以触发词开头。

各类型的字幕技巧

角色
要写: 姿势、视角(正面、侧面)、背景、光线、站在什么上面。
不写: 角色本身的外观——体形、颜色、面部、斑纹——让触发词来承载这些。
产品
要写: 角度、背景、台面、光线、旁边的道具。
不写: 产品的形状、logo区域、图案和材质。
服装
要写: 展示方式(人台、衣架、平铺)、角度、背景。
不写: 版型、面料、缝线、纽扣、颜色。
风格
要写: 每张图片的主体(一棵树、一座房子、一条船)。
不写: 风格本身——纸张层次、柔和阴影、白上加白。
特效
要写: 底下的物体(一颗松果、一把钥匙)及其场景。
不写: 特效本身——霜晶、发光、磨损。
材质
要写: 材质被做成了什么形状,以及如何打光。
不写: 材质的纹理和颜色。
室内
要写: 房间布局、家具、机位、时间段。
不写: 墙面、地面、配色、光线质感。
食物
要写: 盘子、桌子、角度、是否切开。
不写: 菜品本身——酥皮、水果摆法、颜色。
包装
要写: 周围有什么、台面、角度、光线。
不写: 瓶子或盒子的形状、标签区域、瓶盖和颜色。

触发词

一个自己编的短词,用来唤出你的拍摄对象,比如 prodshoot。每条字幕里的写法要一致。

触发词拼写检查 下一个测试版推出

触发词(用来召唤你的主体的词)的不同拼法会被找出来,一步修正。

当前版本尚未包含,推出前不提供操作步骤。

如何批量修改字幕? 现已可用

  1. 打开Caption 工具 › 查找与替换。
  2. 输入要查找的词。
  3. 输入要替换成的内容。
  4. 点击“预览”,逐行查看修改前后。
  5. 点击“应用”。撤销可恢复整批。

查看标签分布 现已可用

  1. 打开 Dataset overview(数据集概览)。
  2. 查看每个标签占图片的比例。
  3. 点击标签查看对应图片,修正偏向某一边的字幕。

如何从我自己的AI获取字幕? 现已可用

  1. 导出所有图片,然后让任意AI为每张图片写一个.txt。
  2. 选择“导入 › 导入字幕包”,然后选取文件。
  3. 确认“写入到”显示的是正确的项目。
  4. 检查各行:MATCH会被写入,SKIP不会。
  5. 点击“写入字幕”。

整个数据集的标签面板 下一个测试版推出

查看每个标签及其使用次数,然后在多张图片上批量添加、删除或重命名,可撤销。

当前版本尚未包含,推出前不提供操作步骤。

逐条检查AI生成的字幕 下一个测试版推出

新旧字幕并排对比,只保留你勾选的。导入前会先备份。

当前版本尚未包含,推出前不提供操作步骤。

05

训练

本章把数据集变成 LoRA,并说明目前哪些是真实运行、哪些是模拟。

当前版本的训练在演示模式(模拟)下运行:不会租用 GPU,也不会产生任何费用。

如何导出训练ZIP? 现已可用

  1. 给每张图片写上字幕;空字幕会阻止导出。
  2. 打开“文件”菜单。
  3. 选择“导出训练包”,或按 ⌘⇧E.
  4. 解压:01.png与01.txt放在一起。
  5. 用kohya(另一款训练工具)训练?按kohya的要求,把文件放进一个以重复次数命名的额外文件夹。

演示模式

如何开始一次训练? 现已可用

  1. 设置步数(学习多少轮)。
  2. 选择云GPU——在网上租用的高性能计算机。
  3. 查看时间和费用预估。
  4. 点击“开始训练”。在本测试版中,训练是模拟的,不产生任何费用。

训练预设与检查清单 下一个测试版推出

选择LoRA类型即可获得现成设置,并在每次训练前提供检查清单。清单给的是建议,不是评分。

当前版本尚未包含,推出前不提供操作步骤。

一键在RunPod上训练 测试期间推出

选择最便宜或最快;Skye Desk挑选可用的GPU,并在租用前显示预估。

当前版本尚未包含,推出前不提供操作步骤。

花费上限与自动停止 测试期间推出

为每次训练设定上限。训练结束、闲置或达到上限时,GPU自动停止。

当前版本尚未包含,推出前不提供操作步骤。

从中断处继续 测试期间推出

如果发生这种情况,训练会在新的GPU上从最近保存的步数继续。

当前版本尚未包含,推出前不提供操作步骤。

连接 Runpod

在 Runpod 上真实训练目前 测试期间推出。你需要一个有余额的 Runpod 账号和一个 API key,粘贴到 Connections(连接)页。

简单模式与高级模式

简单模式只问类型、底模和预算;高级模式显示每一项设置并附说明。 计划中

使用参考图

参考图工作台(Reference Kit):用参考图代替训练 计划中

从设定图构建参考图集,检查后用于支持参考图的图像工具——或者让Skye Desk对比两种方式并给出建议。

当前版本尚未包含,推出前不提供操作步骤。

创作者模式

创作者模式 计划中

围绕角色及其系列打造的更简单的工作区,适合博主、AI网红和短视频创作者。

当前版本尚未包含,推出前不提供操作步骤。

06

生成与对比

本章用你的 LoRA 生成新图片,并帮你留下最好的版本。

如何导回ComfyUI结果? 现已可用

  1. 选择一个图片编号。
  2. 写下它的提示词和反向提示词。
  3. 复制工作流,在ComfyUI中运行。
  4. 按图片编号为每个结果命名,然后导入。

如何对比检查点? 现已可用

  1. 从某次训练的样图中打开盲测。
  2. 从每组A/B中选出更好的一张。
  3. 点击“到此为止并查看结果”查看排名。
  4. 点错了?撤销上一票。

对比训练并设定最终LoRA 下一个测试版推出

在项目页面并排对比两次训练,把其中一个标为最终LoRA,并显示其底模。

当前版本尚未包含,推出前不提供操作步骤。

从图片中找出工作流 下一个测试版推出

Skye Desk读取图片中保存的ComfyUI工作流,并按底模(你的LoRA所依附的AI模型)分组。

当前版本尚未包含,推出前不提供操作步骤。

把提示词用作字幕草稿 下一个测试版推出

把图片中保存的提示词插入字幕,再进行编辑。

当前版本尚未包含,推出前不提供操作步骤。

把提示词发送到ComfyUI 测试期间推出

一次把所有图片编号发送到ComfyUI,并自动填入各自的提示词。

当前版本尚未包含,推出前不提供操作步骤。

检查每张结果是否走样 计划中

每张新图都会与你的主体对比;走样、出现多余文字或logo的图片会被标出,由你决定保留或舍弃。

当前版本尚未包含,推出前不提供操作步骤。

工作流页面:拖入图片即可找到其工作流 计划中

把图片、JSON文件或ZIP拖到工作流页面;每个工作流都会被识别、命名,并与你已有的工作流对比。

当前版本尚未包含,推出前不提供操作步骤。

07

导出并使用 LoRA

本章讲做好的 LoRA 存在哪里、怎么使用。

目前你需要用自己的工具(AI Toolkit 或 OneTrainer)从训练 ZIP 进行训练;LoRA 文件(.safetensors)会出现在该工具的输出文件夹里。

  1. 把 .safetensors 文件复制到 ComfyUI/models/loras。
  2. 在 ComfyUI 里,在模型加载器之后添加一个 Load LoRA 节点。
  3. 选择你的文件,强度先从 0.7–1.0 开始。
  4. 把触发词放在提示词的开头。

各底模的许可不同,有些不允许把生成结果用于商业用途。出售或发布之前,请先查看底模的许可条款。

对比训练并设定最终LoRA 下一个测试版推出

在项目页面并排对比两次训练,把其中一个标为最终LoRA,并显示其底模。

当前版本尚未包含,推出前不提供操作步骤。

08

文件安全

本章说明你的文件在哪里,以及改动如何撤销。

  • 图片和字幕都是工作区文件夹里的普通文件;字幕以 .txt 文件的形式放在图片旁边。
  • 批量修改会先显示预览,并且可以整体撤销。
  • 像备份其他文件夹一样备份工作区文件夹(用 Time Machine 就可以)。

09

隐私与授权

本章讲哪些内容会离开你的 Mac,以及哪些人的照片可以用来训练。

  • 你的图片留在自己的 Mac 上。除非你启动云端训练,否则不会上传任何内容。
  • 只有取得本人书面同意才能用真人照片训练,未成年人一律不行。
  • 未经许可,不要用他人受版权保护的作品或肖像来训练。

隐私政策

10

参考

快捷键、术语和常见问题,都在这里。

键盘快捷键

  • ⌘1–⌘8 依次打开侧边栏各页面(从上到下)。
  • ⌘K 查找任意页面、操作或项目。
  • Space 预览所选图片; ← 和 → 在图片间切换。
  • ⌘, 打开设置; ⌘⇧F 打开字幕查找与替换。

术语表

LoRA
一个小型附加文件,教AI图像模型认识一个主体,比如你的角色、产品或风格。
字幕
描述一张图片的文字。AI会同时从图片和字幕中学习。
标签
字幕中的短语,比如“front view”或“white studio background”。
触发词
一个自造的词,比如wren,在生成新图片时用来召唤你的主体。
底模
你的LoRA所依附的AI图像模型。LoRA只能用于训练时所用的底模系列。
检查点
训练过程中保存的LoRA副本。对比检查点可以看出哪一步效果最好。
云GPU
在网上按小时租用、用来运行训练的高性能计算机。
ComfyUI
一款用AI模型生成图片的免费应用。Skye Desk规划提示词,ComfyUI负责出图。
AI Toolkit, OneTrainer
免费的训练程序。Skye Desk为它们准备所需的文件。

常见问题

macOS 提示无法检查该 App
系统设置 › 隐私与安全性 › 仍要打开(见第 01 章)。
无法导出
每张图片都需要字幕;用“缺少字幕”筛选找出来。
导入的字幕没有对上
字幕文件必须和图片同名(01.png ↔ 01.txt)。
LoRA 把背景也学进去了
换 3–5 种不同的背景重拍,或者在每条字幕里描述背景。

阅读常见问题

图片预览