术语表与 FAQ
初识本地大模型?从这里开始。先是本维基所用术语的通俗定义,随后是大家最常问的问题。
术语表
| 术语 | 含义 |
|---|---|
| LLM(大语言模型) | 一种被训练来预测文本的神经网络。你给它一个提示词;它产生续写。 |
| 推理(Inference) | 运行一个已训练的模型来得到答案(与训练相对,训练是创建模型)。TensorSharp 是一个推理引擎。 |
| GGUF | 一种把模型权重与元数据打包在一起的单文件模型格式。TensorSharp 加载 GGUF 文件,通常从 Hugging Face 下载。 |
| 量化(Quantization) | 把模型权重压缩到更少位数(如 Q4_K_M ≈ 4 位,Q8_0 ≈ 8 位),让模型占用更少内存、运行更快,代价是少量质量损失。 |
| Token | 模型读写的单位 —— 大致是一个词片。“每秒 token 数”衡量速度;“上下文长度”是一次能容纳多少 token。 |
| 分词器(Tokenizer) | 在文本与 token 之间互转。TensorSharp 自带 SentencePiece 与 BPE 分词器。 |
| Prefill vs decode | Prefill 一次性处理你的整个提示词;decode 逐 token 生成回复。两者性能特征不同。 |
| KV 缓存 | 存储较早 token 的注意力“键与值”,使模型不必重算。它让长上下文与多轮对话更高效。→ 分页 KV |
| TTFT | “首 token 时间” —— 答案开始流式输出前需多久。KV 缓存复用会在后续轮次降低它。 |
| 后端(Backend) | 运行数学运算的硬件路径:CPU、NVIDIA GPU(CUDA)、任何 Vulkan GPU(AMD/Intel/NVIDIA)或 Apple Silicon GPU(Metal/MLX)。→ 后端 |
| MoE(专家混合) | 一种把每个 token 路由到少数几个专门子网络(“专家”)而非整张网络的模型,以更低的每 token 计算获得更大容量。 |
| 多模态(Multimodal) | 能接收文本以外的输入 —— 图像、音频或视频。→ 多模态 |
| 思考 / 推理 | 模型在最终答案前产生隐藏的逐步推理;TensorSharp 将两者分离。→ 思考模式 |
| 工具 / 函数调用 | 模型可请求你的应用运行一个函数(如 “get_weather”)并使用结果。→ 工具调用 |
| 连续批处理 | 在单个托管模型上交错运行多个用户的请求,从而同时服务多人,而非一次一个。→ 深入了解 |
| 推测解码 | 一个小“草稿”头猜测若干 token;主模型一次性验证它们 —— 输出更快、结果一致。→ MTP |
| 张量并行(TP) | 把一个模型切分到多张 GPU 上,每张卡持有每层权重的一部分 —— 用于单卡装不下的模型。这与运行模型的多个副本不同。→ 多 GPU 与多节点 |
| AllReduce | 并行组中每张 GPU 把自己的部分结果与其他 GPU 相加的集合通信步骤,结束后所有 GPU 持有相同的值。TensorSharp 在每次行并行投影之后执行它。 |
| 节点 / rank | 在分布式运行中,节点指一台机器,rank 指某张 GPU 在并行组中的位置。全局并行度 = 本机 GPU 数 × 节点数。 |
| 投影器(mmproj) | 一个配套文件,让多模态模型能理解图像/音频。把它放在模型旁,或传入 --mmproj。 |
| 采样(Sampling) | 如何从模型的概率中选取下一个 token。温度、top-p 与 top-k 控制创造性与确定性的平衡。→ 采样 |
常见问题
我需要 GPU 吗?
不需要。TensorSharp 可在普通 CPU 上运行(--backend cpu 或更快的 ggml_cpu)。GPU —— NVIDIA(CUDA)、任何支持 Vulkan 的 AMD/Intel/NVIDIA GPU,或 Apple Silicon(Metal/MLX)—— 会让生成显著更快,尤其是更大的模型。见后端。
我该从哪个模型开始?
建议从 Gemma 4 E4B Q8_0(推荐公开文件为 7.48 GiB)开始 —— 它是 TensorSharp 原生 GGML 快路径上经过验证的快速上手模型,支持思维链、工具调用,以及需要可选投影器的图像/视频/音频输入。内存占用更低的小型入门模型是 Qwen3-4B Q4_K_M(2.33 GiB)。见 E4B 快路径或模型下载。
我的数据私密吗?
是的 —— 推理完全在你的机器上进行。提示词、文档与图像不会发送到任何外部服务。这正是各组织选择本地推理的主要原因。见商业价值。
我能继续用现有的 OpenAI / Ollama 代码吗?
可以。服务器同时支持两种线格式。把 OpenAI 客户端指向 http://localhost:5000/v1(任意 API key),或把 Ollama 客户端指向 http://localhost:5000/api/…。见 HTTP API。
我如何同时服务多个用户?
运行 TensorSharp.Server。它的连续批处理引擎将并发请求交错运行于一个托管模型之上,并在它们之间共享公共提示前缀,从而保持高吞吐。见连续批处理。
我如何让它更快?
- 使用 GPU 后端(
ggml_cuda、ggml_vulkan或ggml_metal)。 - 选更小或量化更激进的模型。
- 在受支持的模型上,用
--mtp-spec启用推测解码。 - 复用会话,让 KV 缓存前缀在轮次间延续。
成本如何?
没有按 token 计费 —— 你在自己掌控的硬件上运行开放模型。成本是硬件以及运行它的电费。见商业价值。
支持哪些平台?
支持基于 .NET 10 的 Windows、Linux 与 macOS(Apple Silicon)。目前请从源码构建:最新 v3.0.5.0 没有上传应用归档。仓库已有跨平台发行工作流,因此在假定预构建文件存在前,请先检查 Releases 页面。见快速开始与平台二进制状态。
它的许可证是什么?
TensorSharp 由 Zhongkai Fu 编写,并按仓库 LICENSE 文件中的许可证(BSD-3-Clause)分发。你下载的每个模型都有其发布者各自的独立许可证 —— 请查看 Hugging Face 上的模型卡。
我在哪里反馈问题或贡献?
在 GitHub 仓库。