功能特性

TensorSharp 目前能力的完整目录。每一项都链接到你可以使用它的页面。

亮点

🧠

多架构

DeepSeek V4 Flash、DeepSeek V4.1 Flash、GLM 5.2、GLM-5.3 与 GLM-5.3-Flash、Gemma 4、Qwen 3.5 / 3.6 / 3.8 Flash Next、GPT OSS、Nemotron-H、Mistral 3、Hunyuan Dense、Muse-Glimmer、DiffusionGemma、Qwen-Image-Edit、MiniMax-H3 音视频、Wan 视频。

🖼️

多模态

图像、视频与音频输入(Gemma 4);多个其他模型支持图像输入。

📄

PDF 文档

在 Web UI 上传 PDF,或在 CLI 传 --pdf —— 文本型 PDF 直接内联,扫描页则交给视觉模型。

🎨

图像编辑

Qwen-Image-Edit 将提示词 + 输入图像转为编辑后的图像(MMDiT 扩散)。

🎬

视频生成

MiniMax-H3 在一份打包潜变量里同时生成视频与原生 32 kHz 立体声音频,无需 CFG,4–8 步即可。Wan 2.1 / 2.2 只生成画面;换用步数蒸馏权重,5 秒 720p 视频可从数小时缩短到几十分钟。

💭

思考模式

结构化的思维链,与可见答案分离。

🛠️

工具调用

跨三种 API 风格的多轮函数调用。

🧩

Agent Skills(智能体技能)

面向模型的说明文件夹,只在任务需要时才加载 —— 用 --skill"skills": ["pdf"] 选中,其余内容由模型通过 TensorSharp 自己应答的内置工具取回。

🤖

智能体工作

有界模型 / 工具循环,带五个代码工具、隔离工作区、沙箱化命令、依赖安装、实时进度与可下载产物。

📦

原生量化计算

Q4_K_M、Q8_0、MXFP4、IQ2_XXS 等在 matmul 中直接运算,无需反量化到 FP32。

🔀

连续批处理

vLLM 式分页 KV 缓存,跨请求前缀共享。

推测解码

MTP / NextN 草稿头,以及 DeepSeek V4 的 DSpark 与 Muse-Glimmer 的 DFlash 块级草稿器加速单序列解码。

🔗

多 GPU 与多节点

张量并行把每一层的权重切分到多张 GPU 上(CUDA 与 GGML 皆可),并通过 TCP 网格跨机器扩展;整模型执行器走的则是分层切分。

🔌

Ollama 与 OpenAI API

面向现有工具的即插即用端点,外加浏览器聊天 UI。

模型与模态

生成与控制

Agent Skills(智能体技能)

性能与扩展

接口与集成