模型下载(GGUF)
每个构件一行:模型本体,以及各家族需要与之搭配的配套文件——投影器、VAE、文本编码器、第二专家、推测解码草稿模型。
模型下载(GGUF)
| 架构 | 模型 | 下载 |
|---|---|---|
| DeepSeek V4.1 | DeepSeek-V4.1-Flash(384 个路由专家,deepseek41) | vcruz305/DeepSeek-V4.1-Flash-GGUF @ 8e0c4de;七个 Q2_K 分片(246.35 GiB,类型混合 Q2_K/Q3_K)放在同一目录,--model 指向第一个;十一个 Q4_K_M 分片(415 GiB)同样已测试,此时两张 51.5 GiB 的 Engram 表只能留在主机内存映射中,路由专家需要卸载到 CPU。不能单独运行:eng/dsv41-prepare.py 依据官方仓库生成 Engram sidecar,eng/dsv41-prepare-vision.py 生成约 970 MB 的视觉伴随文件,图像与视频经 --mmproj 使用。服务后端为 ggml_cuda;没有草稿模型 |
| DeepSeek V4 | DeepSeek-V4-Flash-0731(284B MoE) | unsloth/DeepSeek-V4-Flash-0731-GGUF;每个量化档一个子目录(UD-Q8_K_XL/、UD-IQ4_XS/、UD-IQ1_S/ …),均为多分片——--model 指向 -00001-of- 那一片。仅文本;权重按层切分到所有可见 GPU |
| DeepSeek V4 | DSpark 投机草稿器(可选) | bleysg/DeepSeek-V4-Flash-DSpark-drafter-GGUF 的 DSpark-drafter-Q2K-Q8-0731.gguf(7.0 GB,对应 0731 版本),用 --draft-model 加载可获得约 1.3–1.4× 的 decode 提速。另有两家发布的构建(5.6 GB / 10.9 GB)也可直接加载,见 MODEL_DOWNLOADS_zh-cn.md。其他架构的草稿器属于不同设计,暂不支持 |
| GLM 5.x | GLM-5.2(744B-A40B MoE) | unsloth/GLM-5.2-GGUF;每个量化档一个子目录(UD-Q4_K_XL/、UD-IQ2_XXS/ 等),每档都是多分片集合——--model 指向 -00001-of- 那一片,其余由 GgufFile 自行读取。纯文本;无投影器、无草稿器 |
| GLM 5.x | GLM-5.3(256 个路由专家,glm-dsa) | unsloth/GLM-5.3-GGUF;每种量化一个子目录,均为多分片,--model 指向 -00001-of- 分片。仅文本,该仓库未发布 mmproj。它带有 NextN 块,但该块没有自己的 LM head,因此只有不带 --tp 运行时 --spec 才会生效 |
| GLM 5.x | GLM-5.3-Flash(320B MoE,glm5next) | unsloth/GLM-5.3-Flash-GGUF;每个量化档一个子目录,每档都是多分片集合——--model 指向 -00001-of- 那一片。图像输入需要同仓库的 mmproj-BF16.gguf(GLM-OCR ViT)。与 GLM-5.2 走同一个原生执行器;不传 --tp 时按层切分到所有可见 GPU,而 GGML GPU 后端上的 --tp N 会选择仅支持本地单进程的原生张量并行 |
| Gemma 4 | gemma-4-E4B-it | ggml-org/gemma-4-E4B-it-GGUF;已验证 E4B Q8_0 原生 GGML 规格推荐使用公开文件 gemma-4-E4B-it-Q8_0.gguf;多模态投影器为同仓库的 mmproj-gemma-4-E4B-it-Q8_0.gguf |
| Gemma 4 | gemma-4-12B-it(QAT) | unsloth/gemma-4-12B-it-qat-GGUF;同仓库 mmproj-BF16.gguf 与 mtp-gemma-4-12B-it.gguf |
| Gemma 4 | gemma-4-31B-it | ggml-org/gemma-4-31B-it-GGUF |
| Gemma 4 | gemma-4-26B-A4B-it (MoE) | ggml-org/gemma-4-26B-A4B-it-GGUF |
| Gemma 4 | gemma-4-26B-A4B-it(MoE,QAT) | unsloth/gemma-4-26B-A4B-it-qat-GGUF;同仓库 mmproj-BF16.gguf 与 MTP draft;另有 AtomicChat assistant |
| Qwen 3.5 / 3.6 | Qwen3.5-9B | unsloth/Qwen3.5-9B-GGUF |
| Qwen 3.5 / 3.6 | Qwen3.5-35B-A3B (MoE) | ggml-org/Qwen3.5-35B-A3B-GGUF |
| Qwen 3.6 | Qwen3.6-35B-A3B NextN MTP | unsloth/Qwen3.6-35B-A3B-MTP-GGUF;UD-Q4_K_M 约 21.11 GiB。基础仓库 GGUF 会剥离 NextN 块 |
| Qwen 3.8 Flash Next | Qwen3.8-Flash-Next(混合 MoE,qwen4exp) | unsloth/Qwen3.8-Flash-Next-GGUF;每个量化档一个子目录,每档都是多分片集合——--model 指向 -00001-of- 那一片。图像输入需要同仓库的 mmproj-BF16.gguf。这里的 --tp N 是把层切分到 N 张 GPU,而不是张量并行 |
| GPT OSS | gpt-oss-20b (MoE) | ggml-org/gpt-oss-20b-GGUF |
| Nemotron-H | Nemotron-H-8B-Reasoning-128K | bartowski/nvidia_Nemotron-H-8B-… |
| Nemotron-H | Nemotron-H-47B-Reasoning-128K | bartowski/nvidia_Nemotron-H-47B-… |
| Nemotron-H | Nemotron 3 Nano Omni 30B-A3B(图像) | unsloth/NVIDIA-Nemotron-3-Nano-Omni-…;图像输入需要同仓库 mmproj-BF16.gguf;未附真实音频推理所需的 Parakeet mmproj |
| Nemotron 3.5 | Nemotron-3.5-Lightning-30B-A3B(23 层 Mamba-2 + 23 层 MoE + 6 层注意力) | unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF;可选的 DSpark Markov-head 块级草稿器,用 --draft-model 加载——这是第一个接入块级草稿的循环主干 |
| Mistral 3 | Mistral-Small-3.1-24B-Instruct | bartowski/mistralai_Mistral-Small-3.1-24B-…;Q4_K_M 约 13.35 GiB;同仓库 Pixtral mmproj |
| Hunyuan Dense | 腾讯稠密 Hunyuan(hunyuan-dense),例如 Hy-MT2 | 任何声明该架构的 GGUF;由 general.architecture 决定,与文件名无关。仅文本、单设备,没有投影器也没有草稿模型 |
| Bonsai Q1_0 | Bonsai-8B(qwen3)与 Bonsai-27B(qwen35) | 无下载——仅本地导入;两个 GGUF 既未声明发布仓库 URL,也未声明许可证,因此 TensorSharp 固定其精确字节数与 SHA-256,而不推荐任何仓库。每权重 1.125 比特(Q1_0 即 GGML 类型 41)。仅文本 |
| DiffusionGemma | diffusiongemma-26B-A4B-it | unsloth/diffusiongemma-26B-A4B-it-GGUF;Q4_K_M 约 15.65 GiB |
| Muse-Glimmer | Muse-Glimmer-30B | unsloth/Muse-Glimmer-30B-GGUF;图像输入需要同仓库的 mmproj:mmproj-Muse-Glimmer-30B-Q8_0.gguf |
| Muse-Glimmer | DFlash 投机草稿模型(可选) | unsloth/Muse-Glimmer-30B-GGUF 中的 dflash-*.gguf —— 5 层块级草稿模型,用 --draft-model 加载。验证以贪心方式对齐主干,因此输出与普通贪心 decode 一致 |
| Qwen-Image-Edit | 2511 MMDiT(--model) | unsloth/Qwen-Image-Edit-2511-GGUF;qwen-image-edit-2511-Q4_K_M.gguf 约 12.34 GiB |
| Qwen-Image-Edit | Qwen-Image VAE(必需) | QuantStack/Qwen-Image-Edit-GGUF 中的 VAE/Qwen_Image-VAE.safetensors;通过 --qwen-image-vae 指定 |
| Qwen-Image-Edit | Qwen2.5-VL-7B 文本编码器(必需) | unsloth/Qwen2.5-VL-7B-Instruct-GGUF;可选视觉投影器为同仓库 mmproj-BF16.gguf |
| Qwen-Image-Edit | Lightning LoRA(可选,4/8 步) | lightx2v/Qwen-Image-Edit-2511-Lightning;如 Qwen-Image-Edit-2511-Lightning-4steps-V1.0-bf16.safetensors |
| MiniMax-H3 音视频 | FL2VA 去噪器(--model)—— 文本与关键帧 | unsloth/MiniMax-H3-GGUF 中的 minimax_h3_fl2va_pruned-Q4_K.gguf(10.64 GiB)—— 文生视频、图生视频(这张图就是第一帧)以及首尾帧。H3 是 CFG 蒸馏模型:必须传 --cfg 1.0,4–8 步是快速工作点(默认 20 步)。发布的 GGUF 完全不带元数据,TensorSharp 靠张量识别它们,并从文件名读取分区——重命名或重新量化时请把 fl2va 保留在名字里 |
| MiniMax-H3 音视频 | Ref2VA 去噪器(另一个 --model)—— 文本与参考 | unsloth/MiniMax-H3-GGUF 中的 minimax_h3_ref2va_pruned-Q4_K.gguf(10.60 GiB)—— 即 ref 模式:最多九个身份与外观参考,静图、片段、音轨可任意混合(--ref-image、--ref-video、--ref-video-audio、--ref-audio),用于生成全新场景,而不是必须复现的那几帧。是两个检查点,不是两个开关:向其中一个要另一个的模式会直接失败,报错会指名该去加载哪个文件;关键帧与显式参考同时出现则被直接拒绝。请把 ref2va 保留在文件名里——分区就是从这里读的。下面三行与 FL2VA 共用,所以之后再补这个检查点只需多下它自己的 10.60 GiB |
| MiniMax-H3 音视频 | Qwen3-VL-32B 文本编码器(必需) | unsloth/MiniMax-H3-GGUF 中的 qwen3vl_32b_minimax_h3-Q4_K_M.gguf(16.97 GiB);也可用 -Q2_K_M.gguf(12.20 GiB)搭配更小的去噪器。截断到 50 层并去掉最后的 norm,在去噪开始前就会释放。它不带分词器——见下方提示框。放在去噪器旁边,或用 --video-text-encoder 指定 |
| MiniMax-H3 音视频 | 视频 VAE(必需) | Comfy-Org/MiniMax-H3 中的 minimax_h3_video_vae_fp16.safetensors(5.21 GB)—— 空间 16×、时间 4×,解码器是纯 Transformer,没有反卷积。上面那个 unsloth 仓库的 vae/ 目录下也有镜像。放在去噪器旁边,或用 --video-vae 指定 |
| MiniMax-H3 音视频 | 音频 VAE(可选) | Comfy-Org/MiniMax-H3 中的 minimax_h3_audio_vae_fp32.safetensors(0.61 GB)—— 一个无混叠 BigVGAN,把联合生成的音频潜变量解码成 32 kHz 立体声,作为旁挂 .wav 写在 MP4 旁边。不下载它照样出视频,只是没有声音。用 --audio-vae 指定。在 Ref2VA 上,--ref-audio 也要过它的编码器,所以省掉它连参考音轨也一起没了 |
| Wan 视频 | 步数蒸馏 Wan DiT —— 快车道(推荐) | hum-ma/Wan2.2-TI2V-5B-Turbo-GGUF 中的 Wan2_2-TI2V-5B-Turbo-Q8_0.gguf(5.40 GB)—— 注意 Wan2_2 用的是下划线;最小到 Q2_K(1.86 GB)。从文件名自动识别,无需改任何参数:DiT 前向由 100 次降到 4 次,并关闭引导。A14B 图生视频用 jayn7/WAN2.2-I2V_A14B-DISTILL-LIGHTX2V-4STEP-GGUF,两个专家(high_noise/ 与 low_noise/)都要下载。这两个仓库都不含 VAE 和文本编码器——请从下面两行取 |
| Wan 视频 | 基础 Wan DiT(完整步数配方) | QuantStack/Wan2.2-TI2V-5B-GGUF 中的 Wan2.2-TI2V-5B-Q8_0.gguf(5.40 GB),同仓库已附带 VAE/Wan2.2_VAE.safetensors。另有 Wan2.2-I2V-A14B 与 Wan2.2-T2V-A14B(需同时下载 HighNoise 与 LowNoise 两个专家;两个仓库均附带 Wan 2.1 VAE)、Wan2.1-T2V-14B 与 Wan2.1-T2V-1.3B |
| Wan 视频 | UMT5-XXL 文本编码器(必需) | city96/umt5-xxl-encoder-gguf 中的 umt5-xxl-encoder-Q8_0.gguf(6.04 GB;内存紧张可用 Q5_K_M 4.15 GB 或 Q4_K_M 3.66 GB)—— 放在 DiT 旁边,或用 --video-text-encoder 指定 |
| Wan 视频 | 视频 VAE(必需) | wan_2.1_vae.safetensors;需要哪一个由 DiT 自己决定,不用你选:Wan 2.1 与 A14B 用 wan_2.1_vae.safetensors,TI2V-5B 用 Wan2.2_VAE.safetensors。QuantStack 的两个 A14B 仓库与 TI2V-5B 仓库都已在 VAE/ 下附带,因此只有 Wan 2.1 检查点和蒸馏仓库才需要单独下载。放在 DiT 旁边(VAE/ 子目录亦可)或用 --video-vae 指定 |
🧩
多模态模型需要投影器(mmproj)文件。请下载匹配文件并显式传入 --mmproj;服务端不会自动检测,CLI 也只识别少数旧文件名。
🔤
MiniMax-H3 的文本编码器 GGUF 不带分词器。自动下载只能补上属于命令行选项的那些文件,而分词器不是选项,所以任何配置文件都不会替你取它。请从 MiniMaxAI/MiniMax-H3 的 processor/ 目录下载 vocab.json 与 merges.txt 并放在编码器旁边,或把 TS_VIDEO_TOKENIZER 指向存放它们的目录。
📦
config/minimax-h3-fl2va.json 与 config/minimax-h3-ref2va.json 把四个网络全部写明,第一次运行会自动下载(总计约 33.5 GB),之后直接复用。两个文件只有 model 一项不同,因此文本编码器与两个 VAE 只下载一次并共用——补上第二个检查点只多下一个去噪器,而不是再来一整套。四个网络还是轮流加载、用完即释放,所以显存峰值取决于其中最大的那一个,而不是四者之和。