Appearance
ComfyUI 绘图工作流手册 v0.3.0
本手册涵盖 ComfyUI 图片生成/编辑、视频生成工作流的网页操作,以 Flux fp16 文生图、图像反推+图生图、Qwen-Image-Edit 三件套(姿势控制/多角度可视化/材质替换)、SD15 面部重绘 / SDXL-InstantID 面部一致、LTX 2.3 图音生视频 为完整示例,其余工作流见速览表。
一、概述
ComfyUI 是一款节点式(node-based)AI 绘图环境。每个工作流由若干"节点"用连线串联而成:提示词节点提供文字条件、采样器节点负责生成、VAE 解码节点把潜空间结果转成图片/视频、保存节点输出文件。用户只需修改提示词与少量参数,点击 Queue Prompt 即可出图/出视频。
本环境预置了图片生成、图像编辑、面部处理、视频生成等多类工作流,下面将展示众多工作流的其中几个示例:
| 类别 | 工作流 |
|---|---|
| 文生图 | Flux fp16 四件套 |
| 图生图 | 图像反推 + 图生图(Florence2 自动反推) |
| 图像编辑 | Qwen-Image-Edit 姿势控制(2509)、多角度可视化(2511)、材质替换(2511) |
| 面部 | SD15 面部重绘、SDXL-InstantID 面部一致 |
| 视频 | LTX 2.3 图音生视频(ia2v) |
访问入口:在平台界面点击 ComfyUI 入口,即可跳转至 ComfyUI 网页界面。

本手册结构:第三~七章逐个讲解上述完整示例,均含「小白路径」与「进阶说明」两层;第八章列出其余工作流速览,需要时按相同思路操作。
二、访问与加载工作流
2.1 进入 ComfyUI
在平台界面点击 ComfyUI 入口跳转后,即看到 ComfyUI 主界面:左侧为节点画布,右侧为队列与参数面板,顶部为菜单栏。

2.2 加载工作流
支持两种方式:
方式一:平台预置工作流
ComfyUI 菜单中可直接点选已预置的工作流,加载后节点与连线自动呈现于画布。

方式二:导入 JSON 文件
若工作流以 .json 文件提供,可将文件直接拖入 ComfyUI 画布,或点击顶部菜单 Load 选择文件导入。

提示:导入后若部分节点显示红色,通常是模型文件未就绪,需等待环境加载或联系管理员。
三、文生图示例:Flux fp16 四件套
Flux 是黑森林实验室的文生图模型。"四件套"指 UNet + 双 CLIP(t5xxl + clip_l)+ VAE 四个独立模型文件。该工作流无反向提示词,引导强度由 FluxGuidance 控制。
小白路径
加载 Flux fp16 四件套工作流(见 2.2)
在画布找到标题为 "CLIP文本编码" 的节点,把文本替换成你的英文描述
示例 prompt(可直接复制):
A woman stands in front of the hotel, the name of the hotel is "FP32"确认 "空Latent图像(SD3)" 节点分辨率为 1024×1024(可自行修改)
点击右下角
Queue Prompt开始生成生成完成后,在 "保存图像"(SaveImage) 节点查看并右键保存结果

Flux 不使用反向提示词,画面控制完全靠正向描述与
FluxGuidance引导值。
进阶说明
节点构成(关键节点)
| 节点标题 | class_type | 作用 |
|---|---|---|
| CLIP文本编码 | CLIPTextEncode | 输入正向提示词(无反向) |
| Flux引导 | FluxGuidance | 引导强度 guidance=2.5(替代传统 cfg) |
| UNet加载器 | UNETLoader | 加载 flux1-dev_unet.safetensors |
| 双CLIP加载器 | DualCLIPLoader | 加载 t5xxl_fp16.safetensors + clip_l.safetensors |
| 加载VAE | VAELoader | 加载 ae.safetensors |
| 空Latent图像(SD3) | EmptySD3LatentImage | 生成空潜空间,设宽高 |
| ModelSamplingFlux | ModelSamplingFlux | max_shift=1.15、base_shift=0.5 |
| K采样器选择 | KSamplerSelect | sampler=euler |
| 基础调度器 | BasicScheduler | scheduler=simple、steps=20、denoise=1 |
| 保存图像 | SaveImage | 输出,前缀 ComfyUI |
采样参数
| 参数 | 值 | 说明 |
|---|---|---|
| width × height | 1024 × 1024 | 出图分辨率 |
| steps | 20 | 采样步数 |
| guidance | 2.5 | Flux 引导强度(非传统 cfg) |
| sampler_name | euler | 采样器 |
| scheduler | simple | 调度器 |
| denoise | 1 | 去噪强度,1=完全重绘 |
| batch_size | 1 | 单次出图张数 |
Flux 采用高级采样管线(BasicGuider + KSamplerSelect + BasicScheduler + SamplerCustomAdvanced),没有传统
cfg字段,改用FluxGuidance的 guidance 值控制提示词贴合度,常用 2.5~4.5。
效果展示

Flux fp16 文生图结果(1024×1024,steps=20,guidance=2.5)
四、图像反推 + 图生图示例
该工作流先用 Florence2 视觉模型对输入图自动反推生成详细英文描述,再以该描述为正向提示词做图生图。用户只需传一张图,无需自己写提示词。
小白路径
加载"图像反推+图生图"工作流(见 2.2)
在画布找到 "加载图像"(LoadImage) 节点,上传你想反推并重绘的图片

点击右下角
Queue Prompt——Florence2 会自动反推图片描述,并据此重绘生成完成后,在 "保存图像"(SaveImage) 节点查看结果
默认
denoise=0.8,会保留原图构图但重绘细节;想更接近原图可调低,想大幅改动可调高(见该 KSampler 节点)。
进阶说明
节点构成(关键节点)
| 节点标题 | class_type | 作用 |
|---|---|---|
| 加载图像 | LoadImage | 输入待反推/重绘的图片 |
| 下载并加载 Florence2 模型 | DownloadAndLoadFlorence2Model | 加载 microsoft/Florence-2-base(fp16) |
| Florence2 执行 | Florence2Run | task=more_detailed_caption,自动反推图描述 |
| 显示文本 | ShowText|pysssss | 预览反推出的描述 |
| CLIP文本编码(正) | CLIPTextEncode | 用反推描述作正向 prompt |
| CLIP文本编码(反) | CLIPTextEncode | 反向 embedding:EasyNegative, |
| Checkpoint加载器(简易) | CheckpointLoaderSimple | 加载 anything-v5-PrtRE.safetensors |
| 按宽高比缩放 V2 | ImageScaleByAspectRatioV2 | 长边缩放到 768,保持原宽高比 |
| K采样器 | KSampler | 核心采样 |
| 保存图像 | SaveImage | 输出,前缀 ComfyUI |
采样参数
| 参数 | 值 | 说明 |
|---|---|---|
| scale_to_length | 768 | 输入图长边缩放值(保持原宽高比) |
| steps | 20 | 采样步数 |
| cfg | 8 | 提示词引导强度 |
| sampler_name | euler | 采样器 |
| scheduler | normal | 调度器 |
| denoise | 0.8 | 去噪强度,<1 保留原图构图 |
| Florence2 task | more_detailed_caption | 反推模式:生成详细描述 |
Florence2 反推参数:max_new_tokens=1024、num_beams=3、do_sample=true。反推文本可手动改写后再喂给 CLIPTextEncode,实现"反推→微调→重绘"的精细控制。
效果展示

输入图(待反推/重绘)

重绘结果(denoise=0.8)
Florence2 自动反推描述 → 以该描述为 prompt 做图生图
五、图像编辑示例:Qwen-Image-Edit 三件套
Qwen-Image-Edit 是阿里通义千问的图像编辑模型,可在保持原图主体的前提下做定向编辑。本环境提供三个工作流:姿势控制(2509 模型)、多角度可视化(2511 模型)、材质替换(2511 模型)。三者均用 4 步 Lightning LoRA 加速,cfg=1、euler/simple、denoise=1。
5.1 姿势控制(2509)
把第一张图(人物主体)中的人物,重摆为第二张图(姿势参考)中的姿势,姿势由 OpenPose 自动提取。
小白路径
- 加载"Qwen-Imag-Edit-2509 姿势控制"工作流
- 找到 "Load Image1" 节点,上传人物主体图
- 找到 "Load Pose Image" 节点,上传姿势参考图(系统会用 OpenPose 自动提取其骨架)
- 找到 "字符串(多行)" 节点,填入编辑指令(中文即可):
第一张图片中的女孩,摆出了第二张图片中的姿势 - 点击
Queue Prompt,在 "保存图像" 节点查看结果

进阶说明
| 节点标题 | class_type | 作用 |
|---|---|---|
| Load Image1 | LoadImage | 主体参考图(image1) |
| Load Pose Image | LoadImage | 姿势参考图 |
| OpenPose Pose | OpenposePreprocessor | 从姿势图提取骨架(image2) |
| 字符串(多行) | PrimitiveStringMultiline | 编辑指令 |
| Prompt (Positive) | TextEncodeQwenImageEditPlus | 编码正 prompt(同时传 image1+骨架) |
| Prompt (Negative) | TextEncodeQwenImageEditPlus | 内置长负面词 |
| UNet加载器 | UNETLoader | qwen_image_edit_2509_fp8_e4m3fn_scaled.safetensors |
| 加载CLIP | CLIPLoader | qwen_2.5_vl_7b_fp8_scaled.safetensors(type=qwen_image) |
| 加载VAE | VAELoader | qwen_image_vae.safetensors |
| LoRA加载器(仅模型) | LoraLoaderModelOnly | Qwen-Image-Edit-2509-Lightning-4steps-V1.0-bf16.safetensors(strength=1) |
| K采样器 | KSampler | steps=4、cfg=1、euler、simple、denoise=1 |
| 保存图像 | SaveImage | 前缀 ComfyUI |
附加:ModelSamplingAuraFlow shift=3、CFGNorm strength=1;分辨率由 ImageScaleToTotalPixels(megapixels=1)按主体图缩放。
效果展示

image1:主体图

image2:姿势参考(OpenPose 提取骨架)

结果:主体摆出参考姿势
5.2 多角度可视化(2511)
对单张输入图,生成不同相机视角(水平/垂直角度 + 缩放)的多角度预览。视角由 QwenMultiangleCameraNode 控制,提示词由其内置 96 组视角模板自动生成。
小白路径
加载"Qwen-Imag-Edit-2511 多角度可视化"工作流
找到 "加载图像" 节点,上传主体图

找到 "Qwen Multiangle Camera" 节点,设置视角参数:
horizontal_angle(水平角度),如 56vertical_angle(垂直角度),如 30zoom(缩放),如 4.6default_prompts保持true(用内置板自动生成 prompt)
点击
Queue Prompt,在 "保存图像" 节点查看结果(可用"图像对比"节点对比原图与生成图)

进阶说明
| 节点标题 | class_type | 作用 |
|---|---|---|
| 加载图像 | LoadImage | 主体图 |
| Qwen Multiangle Camera | QwenMultiangleCameraNode | 设置水平/垂直角度、缩放,自动生成多角度 prompt |
| 文本编码(QwenImageEditPlus) | TextEncodeQwenImageEditPlus | 编码正 prompt |
| UNet加载器 | UNETLoader | qwen_image_edit_2511_fp8mixed.safetensors |
| 加载CLIP | CLIPLoader | qwen_2.5_vl_7b_fp8_scaled.safetensors(type=stable_diffusion) |
| 加载VAE | VAELoader | qwen_image_vae.safetensors |
| LoRA加载器(仅模型)×2 | LoraLoaderModelOnly | Qwen-Image-Edit-2511-Lightning-4steps...(strength=1)+ qwen-image-edit-2511-multiple-angles-lora.safetensors(多角度专用,strength=1) |
| K采样器 | KSampler | steps=4、cfg=1、euler、simple、denoise=1 |
| 保存图像 | SaveImage | 前缀 ComfyUI |
注意:此工作流 CLIP 的 type 为
stable_diffusion,与其他两个 Qwen-Edit 工作流(qwen_image)不同,勿随意改;反向 prompt 为空。附加:ModelSamplingAuraFlow shift=3.1、ImageScaleToTotalPixels megapixels=1.2。
效果展示

输入图(原图)

结果:另一相机视角(horizontal=56,vertical=30,zoom=4.6)
5.3 材质替换(2511)
把第一张图(目标物体)的材质,替换为第二张图(材质参考)的材质,如把皮革沙发替换为毛皮。
小白路径
加载"Qwen-Image-Edit2511 材质替换"工作流
找到第一个 "加载图像" 节点(image1),上传目标物体图(如沙发)
找到第二个 "加载图像" 节点(image2),上传材质参考图(如毛皮纹理)

找到 "TextEncodeQwenImageEditPlus (Positive)" 节点,在 prompt 字段填入编辑指令(英文):
Change the furniture leather difference in image 1 to the fur material in image 2.

- 点击
Queue Prompt,在 "保存图像" 节点查看结果

进阶说明
| 节点标题 | class_type | 作用 |
|---|---|---|
| 加载图像(image1) | LoadImage | 目标物体图 |
| 加载图像(image2) | LoadImage | 材质参考图 |
| TextEncodeQwenImageEditPlus (Positive) | TextEncodeQwenImageEditPlus | 正向 prompt(直接填入字段) |
| Edit Model Reference Method | FluxKontextMultiReferenceLatentMethod | 处理双图参考潜在 |
| UNet加载器 | UNETLoader | qwen_image_edit_2511_fp8mixed.safetensors |
| 加载CLIP | CLIPLoader | qwen_2.5_vl_7b_fp8_scaled.safetensors(type=qwen_image) |
| 加载VAE | VAELoader | qwen_image_vae.safetensors |
| LoRA加载器(仅模型) | LoraLoaderModelOnly | Qwen-Image-Edit-2511-Lightning-4steps...(strength=1) |
| K采样器 | KSampler | steps=4、cfg=1、euler、simple、denoise=1 |
| 保存图像 | SaveImage | 前缀 ComfyUI |
两张图分别由 ImageScaleToTotalPixels(megapixels=1)缩放;反向 prompt 为空;ModelSamplingAuraFlow shift=3.1、CFGNorm strength=1。
效果展示

image1:目标物体(皮革沙发)

image2:材质参考(毛皮)

结果:沙发替换为毛皮材质
六、面部示例
6.1 SD15 面部重绘
在文生图基础上,先用 YOLO 检测生成图中的人脸区域,再对人脸单独做局部重绘以增强面部细节。无需提供人脸图,针对"生成图"中的面部做精修。
小白路径
- 加载"SD15 面部重绘"工作流
- 找到正向 "CLIP文本编码" 节点,填入人物描述(英文),示例:
1girl - 确认 "空Latent图像" 节点为 512×512
- 点击
Queue Prompt——先生成整图,再自动检测人脸并重绘面部 - 在 "保存图像" 节点查看结果(可用"图像对比"节点看重绘前后差异)

进阶说明
| 节点标题 | class_type | 作用 |
|---|---|---|
| CLIP文本编码(正/反) | CLIPTextEncode | 正向描述;反向 embedding:EasyNegative, |
| Checkpoint加载器(简易) | CheckpointLoaderSimple | anything-v5-PrtRE.safetensors |
| 检测加载器 | UltralyticsDetectorProvider | bbox/face_yolov8m.pt 人脸检测 |
| 空Latent图像 | EmptyLatentImage | 512×512 生成整图 |
| K采样器 | KSampler | 主采样:steps=20、cfg=8、euler、normal、denoise=1 |
| Detailer (SEGS/pipe) | DetailerForEachPipe | 面部重绘:steps=20、cfg=8、denoise=0.5、guide_size=512 |
| BboxDetectorSEGS | BboxDetectorSEGS | threshold=0.5、dilation=10、crop_factor=3 |
| 保存图像 | SaveImage | 前缀 ComfyUI |
关键参数:面部重绘
denoise=0.5(50% 强度),太高会改掉人物特征,太低无效果;guide_size 控制重绘分辨率。
效果展示

重绘后(面部细节增强,denoise=0.5)
6.2 SDXL-InstantID 面部一致
用户提供一张真实人脸图作为身份参考,生成保持该人物身份的新图像(换场景/换姿势)。通过 InsightFace 提取人脸特征 + ControlNet 引导实现身份保持。
小白路径
- 加载"SDXL-InstantID 面部一致"工作流
- 找到接 ApplyInstantID 的
image输入的 "加载图像" 节点,上传人脸图(身份参考) - 找到接
image_kps输入的 "加载图像" 节点,上传姿势/关键点参考图 - 找到正向 "CLIP文本编码" 节点,填入新场景描述(英文),示例:
On the campus, a girl is looking at the camera.

- 点击
Queue Prompt,在 "保存图像" 节点查看结果

进阶说明
| 节点标题 | class_type | 作用 |
|---|---|---|
| 加载图像 ×2 | LoadImage | 人脸图(image)+ 姿势参考图(image_kps) |
| CLIP文本编码(正/反) | CLIPTextEncode | 正向场景描述;反向 text, watermark |
| Checkpoint加载器(简易) | CheckpointLoaderSimple | dreamshaperXL_lightningDPMSDE.safetensors(SDXL Lightning) |
| Load InstantID Model | InstantIDModelLoader | ip-adapter_instant_id_sdxl.bin |
| InstantID Face Analysis | InstantIDFaceAnalysis | InsightFace 人脸分析(provider=CPU) |
| 加载ControlNet模型 | ControlNetLoader | control_instant_id_sdxl.safetensors |
| Apply InstantID | ApplyInstantID | weight=0.8、start_at=0、end_at=1 |
| K采样器 | KSampler | steps=4、cfg=1.2、dpmpp_sde、normal、denoise=1、768×1024 |
| 保存图像 | SaveImage | 前缀 ComfyUI |
关键参数:
weight=0.8控制身份强度,越高越像参考人脸,过高易出伪影;配合 Lightning checkpoint 用 4 步快速采样。
效果展示

人脸图(身份参考)

姿势参考图

结果:保持身份的新场景图(weight=0.8)
七、图音生视频示例:LTX 2.3
LTX 2.3 图音生视频(ia2v)工作流:提供 1 张图 + 1 段音频 + 提示词,生成带同步音频的视频。这是本环境中唯一输出带音频视频的工作流。
小白路径
加载"LTX2.3 图像加音频到视频"工作流
找到 "加载图像"(LoadImage) 节点,上传起始图片
找到 "Load Audio (Upload)" 节点,上传音频文件(如 mp3),设置
duration(时长,秒),如 7
找到正向 "CLIP文本编码" 节点,填入画面动态描述(英文),示例:
blurry, low quality, still frame, frames, watermark, overlay, titles, has blurbox, has subtitles, oily skin

- 点击
Queue Prompt开始生成(视频生成耗时较长,请耐心等待) - 生成完成后,在 "保存视频"(SaveVideo) 节点查看并右键保存

输出视频带同步音频(来自你上传的音频)。默认 1080×1920 竖屏、7 秒、24 fps。
进阶说明
节点构成(关键节点)
| 节点标题 | class_type | 作用 |
|---|---|---|
| 加载图像 | LoadImage | 起始图片 |
| Load Audio (Upload) | VHS_LoadAudioUpload | 输入音频,设 start_time/duration |
| CLIP文本编码(正/反) | CLIPTextEncode | 正向动态描述;反向内置质量负面词 |
| UNet加载器 | UNETLoader | ltx-2.3-22b-dev_transformer_only_fp8_scaled.safetensors |
| 双CLIP加载器 | DualCLIPLoader | gemma_3_12B_it_fp4_mixed.safetensors + ltx-2.3_text_projection_bf16.safetensors |
| LoRA加载器(仅模型) | LoraLoaderModelOnly | ltx-2.3-22b-distilled-lora-384.safetensors(strength=0.7) |
| VAELoader KJ ×2 | VAELoaderKJ | 视频 VAE LTX23_video_vae_bf16.safetensors + 音频 VAE LTX23_audio_vae_bf16.safetensors |
| 自定义Sigmas | ManualSigmas | 手动控制 sigma 序列(8 步) |
| CFG引导器 | CFGGuider | cfg=1 |
| K采样器选择 | KSamplerSelect | sampler=euler |
| 数学表达式 | MathExpression | 计算帧数 Duration×FPS+1 |
| VAE解码(分块) | VAEDecodeTiled | tile_size=768、overlap=64 |
| 保存视频 | SaveVideo | 前缀 LTX2.3-、mp4、h264 |
采样参数
| 参数 | 值 | 说明 |
|---|---|---|
| Width × Height | 1080 × 1920 | 竖屏分辨率 |
| Duration | 7 | 时长(秒,与音频 duration 对应) |
| FPS | 24 | 帧率 |
| 总帧数 | 169 | 由 Duration×FPS+1 自动计算(7×24+1) |
| steps | 8 | 由 ManualSigmas 的 9 个 sigma 值决定 |
| cfg | 1 | 提示词引导强度 |
| sampler | euler | 采样器 |
| sigmas | 1., 0.99375, 0.9875, 0.98125, 0.975, 0.909375, 0.725, 0.421875, 0.0 | 手动 sigma 序列 |
| 音频 | 真实音轨 | 来自上传音频,输出带同步音频 |
反向提示词内置:
blurry, low quality, still frame, frames, watermark, overlay, titles, has blurbox, has subtitles, oily skin,一般无需修改。图像会先缩放到 1080×1920,再按长边 1536 供 LTXVPreprocess 使用(img_compression=33)。
效果展示
输入图 + 音频:

输入图(ltx23_img_input.png)
输入音频(ltx_23_audio_input.mp3,7s)
生成视频(带同步音频):
🎬 LTX 2.3 图音生视频结果(1080×1920 竖屏,24fps,7s,带同步音频)
八、其余工作流速览
下表列出本环境其余工作流,操作思路与第三~七章一致:找到提示词节点改 prompt、找到输入节点传图/音频、确认开关、点 Queue。
| 工作流 | 类型 | 所需输入 | 用途 |
|---|---|---|---|
| Ernie-Image 文生图 | 图片 | 正向提示词 | 百度 Ernie 文生图,内置提示词增强开关,1024×1024、steps=20、cfg=4、euler/simple |
| Z-Image 文生图 | 图片 | 正向提示词 | 质感向文生图,steps=35、res_multistep 采样器、AuraFlow shift=3 |
| LTX 2.3 t2v | 视频 | 提示词 | 文生视频,两阶段管线,空音轨无声 |
| LTX 2.3 i2v | 视频 | 图 + 提示词 | 图生视频,双阶段管线,空音轨 |
| LTX 2.3 ia2v | 视频 | 图 + 音频 + 提示词 | 图+音频生视频,输出带同步音频 |
| LTX 2.3 flf2v | 视频 | 首帧 + 尾帧 + 提示词 | 首尾帧生视频,distilled 模型、EulerAncestral 单阶段 9 步,无提示词增强 |
| LTX 2.3 风格转换模板 | 视频 | 首帧 + 尾帧 + 提示词 | 风格渐变(如摄影→水彩),prompt 含 zhuanchang 触发词,720×1280 竖屏 6 秒带音频 |
| 6 关键帧模板 | 视频 | 6 张关键帧 + 各段提示词 | 关键帧链式分段生成长视频,5 段首尾相接拼接 |
| Wan 2.2 14B i2v | 视频 | 图 + 提示词 | 图生视频,可选 4 步加速,640×640 |
| Wan 2.2 fun_camera | 视频 | 图 + 提示词 + 摄像机参数 | 摄像机轨迹控制,操作 WanCameraEmbedding 节点,720×720 |
| Wan 2.2 fun_control | 视频 | 参考图 + 控制视频 + 提示词 | 控制视频(姿态/运动)引导生成,替换 LoadVideo 控制视频 |
| Wan 2.2 fun_inpaint | 视频 | 首帧 + 尾帧 + 提示词 | 首尾帧过渡生成,默认 4 步加速 |
九、常用提示词模板
文生图模板
# Flux 文生图(纯正向,无反向)
masterpiece, best quality, 8K, ultra-detailed, cinematic lighting, <主体描述>, <环境/背景>, <氛围/风格>, clean background, professional图像编辑模板(Qwen-Image-Edit)
# 姿势控制(中文指令)
第一张图片中的<主体>,摆出了第二张图片中的姿势
# 材质替换(英文指令)
Change the <原图材质> in image 1 to the <目标材质> material in image 2.视频模板
# LTX 图音生视频(动作 + 镜头 + 光影 + 质感)
<主体动作描述>, <镜头运动如 camera dolly out / close-up>, <光影如 dramatic lighting / golden hour>, <质感如 photorealism, 8K, sharp focus>十、参数调优指南(进阶)
| 参数 | 含义 | 调参方向 |
|---|---|---|
| steps | 采样步数 | 越多细节越丰富但越慢;Lightning/Qwen-Edit 用 4 步,Flux/SD 用 20 步 |
| cfg / guidance | 提示词引导强度 | Flux 用 guidance(2.5~4.5);SD/Qwen-Edit 用 cfg(1~8),过大易过饱和 |
| sampler | 采样器 | euler 稳定通用;SDXL Lightning 用 dpmpp_sde;Z-Image 用 res_multistep |
| scheduler | 调度器 | simple/normal 为常用默认,LTX 用 ManualSigmas 手动控制 |
| denoise | 去噪强度 | 1=完全重绘;图生图/面部重绘时 <1 保留原图(图生图 0.8、面部 0.5) |
| 分辨率 | width×height | 显存不足时降低;Qwen-Edit 用 ImageScaleToTotalPixels(megapixels)控制 |
| Duration / FPS | 视频时长/帧率 | 帧数 = Duration×FPS+1,帧数越多越占显存 |
| InstantID weight | 身份强度 | 0.8 常用;过高伪影,过低不像参考人脸 |
| Lightning LoRA | 4 步加速 | 配合 Lightning checkpoint/LoRA,steps 降至 4,出图快 |
十一、常见问题
| 问题现象 | 可能原因 | 解决方案 |
|---|---|---|
| 出图全黑或报错 | 模型文件未加载完成 | 等待环境加载,或重载工作流;节点变红多为模型未就绪 |
| Flux 出图不贴合描述 | guidance 过低 | 调高 FluxGuidance 的 guidance 值(2.5→4.0) |
| 图生图改动太小/太大 | denoise 不合适 | 想更接近原图调低 denoise,想大幅改动调高 |
| Qwen-Edit 编辑不生效 | prompt 指令不明确 / 图传错位置 | 指令明确说"image 1 … image 2 …";确认图接到对应 LoadImage 节点 |
| InstantID 不像参考人脸 | weight 太低 / 人脸图质量差 | 调高 weight(0.8→1.0);换清晰正脸图 |
| 面部重绘后人物变样 | denoise 过高 | 调低 DetailerForEachPipe 的 denoise(0.5→0.3) |
| 生成报显存不足(OOM) | 分辨率/时长过大 | 降低 width/height 或 megapixels;视频缩短 Duration 或降 FPS |
| Queue 无反应 | 队列堆积 | 查看右侧队列面板,清除历史任务或刷新页面 |
| 视频无声 | 用了 t2v / i2v 工作流 | t2v、i2v 为空音轨;需带音频视频用 LTX 2.3 图音生视频(第七章) |
| Qwen-Edit 报 CLIP 错误 | CLIP type 改错 | 多角度可视化用 stable_diffusion,其余两个用 qwen_image,勿混 |
更新日志
| 版本 | 日期 | 更新内容 |
|---|---|---|
| v0.3.0 | 2026.07.21 | 每个示例新增「效果展示」:图片示例用图廊、视频示例用 video 标签(带音频)、图音生视频附输入音频 audio 标签 |
| v0.2.0 | 2026.07.21 | 工作流:Flux fp16 文生图、图像反推+图生图、Qwen-Image-Edit 三件套(姿势控制/多角度可视化/材质替换)、SD15 面部重绘、SDXL-InstantID 面部一致、LTX 2.3 图音生视频,共 8 个完整示例;原工作流移入速览表 |
| v0.1.0 | 2026.07.21 | 初始版本:Ernie-Image 文生图、LTX 2.3 t2v 文生视频、Wan 2.2 14B i2v 图生视频完整示例 |