LongCat-Image 本地部署指南:ComfyUI 工作流、显存需求与 GGUF 量化

2026/07/16

搜"LongCat ComfyUI",出来的大多是 LongCat-Video 的教程——那是美团另一个模型。如果你照着做发现对不上,这篇就是纠错指南:只讲 LongCat-Image(文生图 + 图像编辑模型),所有数字取自官方仓库而非以讹传讹。

太长不看 — LongCat-Image 自 2026 年 3 月起被 ComfyUI 官方原生支持。bf16 扩散模型是 12.5 GB 单文件;官方 README 标注开 CPU offload 时文生图约需 17 GB(Edit 版约 18 GB)。社区 GGUF 当前最低列到 2.1 GB,但文件体积不等于运行显存。

先搞清楚你要下载什么

"6B 参数"这个说法容易让人低估体积:6B 指的只是 DiT 主干,HuggingFace 完整 pipeline 约 29.3 GB:

组件大小
文本编码器(Qwen 系 VLM,5 个分片)16.58 GB
扩散 Transformer12.54 GB
VAE0.17 GB

LongCat-Image-Edit 结构与大小完全相同。两个仓库均为 Apache-2.0 协议,且官方仓库内没有任何额外的输出使用限制条款——生成图片商用不受协议限制。

路径一:ComfyUI 官方原生支持(推荐)

ComfyUI 官方 changelog记录原生实现于 2026-03-05 加入;LongCat 项目方在 2026-03-22 公告接入。当前版本原生支持 LongCat-Image、LongCat-Image-Edit 和 Edit-Turbo,无需自定义节点。(老教程里的 sooxt98/comfyui_longcat_image 属于原生支持前的时代。)

  1. 更新 ComfyUI 到包含 2026 年 3 月原生实现的当前版本。
  2. 下载官方重打包权重 Comfy-Org/LongCat-Image——split_files/diffusion_models/ 下三个 bf16 文件(各 12.54 GB):
    • longcat_image — 文生图
    • longcat_image_edit — 指令式编辑
    • longcat_image_edit_turbo — 蒸馏加速编辑版(2026-02-03 发布)
  3. 放入 ComfyUI/models/diffusion_models/,按 comfy.org 模型页配齐文本编码器和 VAE,加载模板工作流即可。

注意 Comfy-Org 重打包只有 bf16,没有官方 fp8。要更小的体积走下面的 GGUF 路径。

显存需求(官方数字)

官方 README 的快速开始默认开启 enable_model_cpu_offload(),标注:

  • 文生图:约需 17 GB
  • 编辑:约需 18 GB

两句实话。第一,这是 CPU offload 模式的数字——文本编码器会在显存和系统内存间换入换出,所以系统内存建议 32 GB+,速度会有折损;显存充裕的卡可以整个 pipeline 常驻(pipe.to("cuda"))换更快的生成。第二,量化版没有任何官方显存数字——网上给 GGUF 报精确显存的都是按文件大小估的。

实用对照:

你的显卡现实路线
24 GB+(4090/5090)bf16,全量或部分 offload
16 GBbf16 + CPU offload,按官方数字文生图可跑但很紧
8–12 GBGGUF Q8_0 / Q4_K_M
8 GB 以下GGUF Q3/Q4,或直接用云端

路径二:低显存用 GGUF 量化

社区量化版(非官方)来自 vantagewithai/LongCat-Image-GGUF(含 ComfyUI 就绪文件)和 stduhpf/LongCat-Image-gguf,Edit 和 Edit-Turbo 也有对应量化:

量化档文件大小质量取舍
Q2_K2.1 GB当前最小列出版本,质量损失严重,只适合试验
Q3_K_S2.76 GB明显劣化,出草稿够用
Q4_K_M3.66 GB8–12 GB 卡的平衡之选
Q8_06.71 GB接近 bf16 质量
BF1612.54 GB基准

文字渲染是 LongCat-Image 的招牌能力——在覆盖 8105 个规范汉字的 benchmark 上准确率 90.7%,对比 Seedream 4.0 的 58.5%、Qwen-Image 的 56.6%(技术报告)——但它通常也是激进量化最先伤到的能力。如果你选这个模型就是为了图内文字,请停留在 Q8_0 及以上。

路径三:纯 Python(diffusers)

官方 diffusers pipeline:LongCatImagePipeline 和 LongCatImageEditPipeline(文档):

import torch
from diffusers import LongCatImagePipeline

pipe = LongCatImagePipeline.from_pretrained(
    "meituan-longcat/LongCat-Image", torch_dtype=torch.bfloat16
)
pipe.enable_model_cpu_offload()  # 官方 README:约需 17 GB

image = pipe(
    '霓虹灯招牌,写着"深夜食堂 Midnight Diner",雨夜街道,照片级写实',
    num_inference_steps=50,
).images[0]
image.save("out.png")

什么时候本地部署不划算

本地适合大批量、隐私敏感或想玩 LoRA 的场景。其余情况先算账:

  • fal.ai API:文生图 $0.13/百万像素,编辑 $0.15/MP——1 美元约出 7–8 张 1MP 图,零配置。
  • longcat-image.org:浏览器里直接用同款模型,注册送免费额度——在下载 29 GB 权重之前,先花几分钟验证 LongCat-Image 的文字渲染是否符合你的需求。在线使用教程见这篇。

常见问题

这和 LongCat-Video / LongCat-Flash 是一回事吗? 不是。美团 LongCat 家族横跨对话、视频、图像多个模型。本文只讲 LongCat-Image(权重 2025-12-05 开源)——网上大部分错误信息都源于把家族成员搞混。

生成结果能商用吗? Apache-2.0 协议,官方仓库无额外输出限制条款。

Edit 支持多张参考图吗? 单次编辑只接受一张参考图。


想对比量化版和全精度云端模型的效果?在线用 LongCat-Image 生成 →

Longcat Image Team

Longcat Image Team