搜"LongCat ComfyUI",出来的大多是 LongCat-Video 的教程——那是美团另一个模型。如果你照着做发现对不上,这篇就是纠错指南:只讲 LongCat-Image(文生图 + 图像编辑模型),所有数字取自官方仓库而非以讹传讹。
太长不看 — LongCat-Image 自 2026 年 3 月起被 ComfyUI 官方原生支持。bf16 扩散模型是 12.5 GB 单文件;官方 README 标注开 CPU offload 时文生图约需 17 GB(Edit 版约 18 GB)。社区 GGUF 当前最低列到 2.1 GB,但文件体积不等于运行显存。
先搞清楚你要下载什么
"6B 参数"这个说法容易让人低估体积:6B 指的只是 DiT 主干,HuggingFace 完整 pipeline 约 29.3 GB:
| 组件 | 大小 |
|---|---|
| 文本编码器(Qwen 系 VLM,5 个分片) | 16.58 GB |
| 扩散 Transformer | 12.54 GB |
| VAE | 0.17 GB |
LongCat-Image-Edit 结构与大小完全相同。两个仓库均为 Apache-2.0 协议,且官方仓库内没有任何额外的输出使用限制条款——生成图片商用不受协议限制。
路径一:ComfyUI 官方原生支持(推荐)
ComfyUI 官方 changelog记录原生实现于 2026-03-05 加入;LongCat 项目方在 2026-03-22 公告接入。当前版本原生支持 LongCat-Image、LongCat-Image-Edit 和 Edit-Turbo,无需自定义节点。(老教程里的 sooxt98/comfyui_longcat_image 属于原生支持前的时代。)
- 更新 ComfyUI 到包含 2026 年 3 月原生实现的当前版本。
- 下载官方重打包权重 Comfy-Org/LongCat-Image——
split_files/diffusion_models/下三个 bf16 文件(各 12.54 GB):longcat_image— 文生图longcat_image_edit— 指令式编辑longcat_image_edit_turbo— 蒸馏加速编辑版(2026-02-03 发布)
- 放入
ComfyUI/models/diffusion_models/,按 comfy.org 模型页配齐文本编码器和 VAE,加载模板工作流即可。
注意 Comfy-Org 重打包只有 bf16,没有官方 fp8。要更小的体积走下面的 GGUF 路径。
显存需求(官方数字)
官方 README 的快速开始默认开启 enable_model_cpu_offload(),标注:
- 文生图:约需 17 GB
- 编辑:约需 18 GB
两句实话。第一,这是 CPU offload 模式的数字——文本编码器会在显存和系统内存间换入换出,所以系统内存建议 32 GB+,速度会有折损;显存充裕的卡可以整个 pipeline 常驻(pipe.to("cuda"))换更快的生成。第二,量化版没有任何官方显存数字——网上给 GGUF 报精确显存的都是按文件大小估的。
实用对照:
| 你的显卡 | 现实路线 |
|---|---|
| 24 GB+(4090/5090) | bf16,全量或部分 offload |
| 16 GB | bf16 + CPU offload,按官方数字文生图可跑但很紧 |
| 8–12 GB | GGUF Q8_0 / Q4_K_M |
| 8 GB 以下 | GGUF Q3/Q4,或直接用云端 |
路径二:低显存用 GGUF 量化
社区量化版(非官方)来自 vantagewithai/LongCat-Image-GGUF(含 ComfyUI 就绪文件)和 stduhpf/LongCat-Image-gguf,Edit 和 Edit-Turbo 也有对应量化:
| 量化档 | 文件大小 | 质量取舍 |
|---|---|---|
| Q2_K | 2.1 GB | 当前最小列出版本,质量损失严重,只适合试验 |
| Q3_K_S | 2.76 GB | 明显劣化,出草稿够用 |
| Q4_K_M | 3.66 GB | 8–12 GB 卡的平衡之选 |
| Q8_0 | 6.71 GB | 接近 bf16 质量 |
| BF16 | 12.54 GB | 基准 |
文字渲染是 LongCat-Image 的招牌能力——在覆盖 8105 个规范汉字的 benchmark 上准确率 90.7%,对比 Seedream 4.0 的 58.5%、Qwen-Image 的 56.6%(技术报告)——但它通常也是激进量化最先伤到的能力。如果你选这个模型就是为了图内文字,请停留在 Q8_0 及以上。
路径三:纯 Python(diffusers)
官方 diffusers pipeline:LongCatImagePipeline 和 LongCatImageEditPipeline(文档):
import torch
from diffusers import LongCatImagePipeline
pipe = LongCatImagePipeline.from_pretrained(
"meituan-longcat/LongCat-Image", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload() # 官方 README:约需 17 GB
image = pipe(
'霓虹灯招牌,写着"深夜食堂 Midnight Diner",雨夜街道,照片级写实',
num_inference_steps=50,
).images[0]
image.save("out.png")什么时候本地部署不划算
本地适合大批量、隐私敏感或想玩 LoRA 的场景。其余情况先算账:
- fal.ai API:文生图 $0.13/百万像素,编辑 $0.15/MP——1 美元约出 7–8 张 1MP 图,零配置。
- longcat-image.org:浏览器里直接用同款模型,注册送免费额度——在下载 29 GB 权重之前,先花几分钟验证 LongCat-Image 的文字渲染是否符合你的需求。在线使用教程见这篇。
常见问题
这和 LongCat-Video / LongCat-Flash 是一回事吗? 不是。美团 LongCat 家族横跨对话、视频、图像多个模型。本文只讲 LongCat-Image(权重 2025-12-05 开源)——网上大部分错误信息都源于把家族成员搞混。
生成结果能商用吗? Apache-2.0 协议,官方仓库无额外输出限制条款。
Edit 支持多张参考图吗? 单次编辑只接受一张参考图。
想对比量化版和全精度云端模型的效果?在线用 LongCat-Image 生成 →
