术语表与 FAQ

初识本地大模型?从这里开始。先是本维基所用术语的通俗定义,随后是大家最常问的问题。

术语表

术语含义
LLM(大语言模型)一种被训练来预测文本的神经网络。你给它一个提示词;它产生续写。
推理(Inference)运行一个已训练的模型来得到答案(与训练相对,训练是创建模型)。TensorSharp 是一个推理引擎。
GGUF一种把模型权重与元数据打包在一起的单文件模型格式。TensorSharp 加载 GGUF 文件,通常从 Hugging Face 下载。
量化(Quantization)把模型权重压缩到更少位数(如 Q4_K_M ≈ 4 位,Q8_0 ≈ 8 位),让模型占用更少内存、运行更快,代价是少量质量损失。
Token模型读写的单位 —— 大致是一个词片。“每秒 token 数”衡量速度;“上下文长度”是一次能容纳多少 token。
分词器(Tokenizer)在文本与 token 之间互转。TensorSharp 自带 SentencePiece 与 BPE 分词器。
Prefill vs decodePrefill 一次性处理你的整个提示词;decode 逐 token 生成回复。两者性能特征不同。
KV 缓存存储较早 token 的注意力“键与值”,使模型不必重算。它让长上下文与多轮对话更高效。→ 分页 KV
TTFT“首 token 时间” —— 答案开始流式输出前需多久。KV 缓存复用会在后续轮次降低它。
后端(Backend)运行数学运算的硬件路径:CPU、NVIDIA GPU(CUDA)、任何 Vulkan GPU(AMD/Intel/NVIDIA)或 Apple Silicon GPU(Metal/MLX)。→ 后端
MoE(专家混合)一种把每个 token 路由到少数几个专门子网络(“专家”)而非整张网络的模型,以更低的每 token 计算获得更大容量。
多模态(Multimodal)能接收文本以外的输入 —— 图像、音频或视频。→ 多模态
思考 / 推理模型在最终答案前产生隐藏的逐步推理;TensorSharp 将两者分离。→ 思考模式
工具 / 函数调用模型可请求你的应用运行一个函数(如 “get_weather”)并使用结果。→ 工具调用
连续批处理在单个托管模型上交错运行多个用户的请求,从而同时服务多人,而非一次一个。→ 深入了解
推测解码一个小“草稿”头猜测若干 token;主模型一次性验证它们 —— 输出更快、结果一致。→ MTP
张量并行(TP)一个模型切分到多张 GPU 上,每张卡持有每层权重的一部分 —— 用于单卡装不下的模型。这与运行模型的多个副本不同。→ 多 GPU 与多节点
AllReduce并行组中每张 GPU 把自己的部分结果与其他 GPU 相加的集合通信步骤,结束后所有 GPU 持有相同的值。TensorSharp 在每次行并行投影之后执行它。
节点 / rank在分布式运行中,节点指一台机器,rank 指某张 GPU 在并行组中的位置。全局并行度 = 本机 GPU 数 × 节点数。
投影器(mmproj)一个配套文件,让多模态模型能理解图像/音频。把它放在模型旁,或传入 --mmproj
采样(Sampling)如何从模型的概率中选取下一个 token。温度top-ptop-k 控制创造性与确定性的平衡。→ 采样

常见问题

我需要 GPU 吗?

不需要。TensorSharp 可在普通 CPU 上运行(--backend cpu 或更快的 ggml_cpu)。GPU —— NVIDIA(CUDA)、任何支持 Vulkan 的 AMD/Intel/NVIDIA GPU,或 Apple Silicon(Metal/MLX)—— 会让生成显著更快,尤其是更大的模型。见后端

我该从哪个模型开始?

建议从 Gemma 4 E4B Q8_0(推荐公开文件为 7.48 GiB)开始 —— 它是 TensorSharp 原生 GGML 快路径上经过验证的快速上手模型,支持思维链、工具调用,以及需要可选投影器的图像/视频/音频输入。内存占用更低的小型入门模型是 Qwen3-4B Q4_K_M(2.33 GiB)。见 E4B 快路径模型下载

我的数据私密吗?

是的 —— 推理完全在你的机器上进行。提示词、文档与图像不会发送到任何外部服务。这正是各组织选择本地推理的主要原因。见商业价值

我能继续用现有的 OpenAI / Ollama 代码吗?

可以。服务器同时支持两种线格式。把 OpenAI 客户端指向 http://localhost:5000/v1(任意 API key),或把 Ollama 客户端指向 http://localhost:5000/api/…。见 HTTP API

我如何同时服务多个用户?

运行 TensorSharp.Server。它的连续批处理引擎将并发请求交错运行于一个托管模型之上,并在它们之间共享公共提示前缀,从而保持高吞吐。见连续批处理

我如何让它更快?

成本如何?

没有按 token 计费 —— 你在自己掌控的硬件上运行开放模型。成本是硬件以及运行它的电费。见商业价值

支持哪些平台?

支持基于 .NET 10 的 Windows、Linux 与 macOS(Apple Silicon)。目前请从源码构建:最新 v3.0.5.0 没有上传应用归档。仓库已有跨平台发行工作流,因此在假定预构建文件存在前,请先检查 Releases 页面。见快速开始平台二进制状态

它的许可证是什么?

TensorSharp 由 Zhongkai Fu 编写,并按仓库 LICENSE 文件中的许可证(BSD-3-Clause)分发。你下载的每个模型都有其发布者各自的独立许可证 —— 请查看 Hugging Face 上的模型卡。

我在哪里反馈问题或贡献?

GitHub 仓库