BaseRT:专为 Apple Silicon 优化,让 Mac 本地大模型快 6.4 倍

Apple Silicon 跑本地大模型,速度还能再提升多少?
BaseRT 给出了一个答案:在 M5 Pro 上,它的提示词处理速度最高达到 llama.cpp 的 6.4 倍,MLX 的 3.9 倍

BaseRT:专为 Apple Silicon 优化,让 Mac 本地大模型快 6.4 倍 1

BaseRT 是一款专为 Apple Silicon 优化的本地 AI 推理引擎,可以运行 Qwen、Llama、Gemma 等多种开源模型。

在对比测试中,BaseRT 的优势主要集中在 Prefill(提示词处理)阶段,在 Decode(生成速度)阶段也有一定提升:

模型阶段对比 llama.cpp对比 MLX
Prefill(提示词处理速度)最高 6.4 倍最高 3.9 倍
Decode(生成速度)最高 1.75 倍最高 1.33 倍

如何使用

安装

curl -LsSf https://basecompute.co/install.sh | sh

下载模型

basert pull Qwen/Qwen3-4B

运行对话

basert chat Qwen/Qwen3-4B

就可在终端中与本地模型对话了。

启动 API

basert serve Qwen/Qwen3-4B --port 8080

BaseRT 会提供 OpenAI 兼容接口:

http://localhost:8080/v1

为什么 BaseRT 可以跑得更快?

大模型运行速度,不只取决于芯片性能,也取决于软件是否能够充分利用硬件。

与 llama.cpp、MLX 等已有本地推理方案相比,BaseRT 的优化重点是利用 Apple Silicon 的硬件特性。在 M5 Pro 测试中,它利用 M5 新增的 Tensor Core 架构,以及 Metal 4 Tensor API 提供的底层计算能力,获得了明显的性能提升。

BaseRT 在 Qwen3、Qwen3.5、Qwen3.6、Llama 3.2、Gemma 4 等多个模型上进行了测试,覆盖 0.6B 到 35B 参数规模。

使用的设备:Apple M5 Pro、48 GB 内存。

Prefill(提示词处理速度)

ModelBaseRT pp128llama.cpp pp128BaseRT pp256llama.cpp pp256BaseRT pp512llama.cpp pp512BaseRT pp1024llama.cpp pp1024BaseRT pp2048llama.cpp pp2048
Qwen3-0.6B11873105591757814093245251735029062189733118319232
Llama-3.2-1B89366859134919267195391192223952137422744314358
Qwen3.5-2B4594390869945224106626888141378121162918500
Llama-3.2-3B366328315658384584285115112066132133156577
Gemma-4-E2B4991199278252524123802631146612600162642547
Gemma-4-26B-A4B2246118534481488524618976718220878572419
Qwen3-30B-A3B2478128037671592566320437357232486442586
Qwen3.5-35B-A3B1501106522591356352516524577189453042094
Qwen3.6-35B-A3B1361104220531331319816144202184748602051
Qwen3.6-27B440358664453102156014166621706747

Decode(生成速度)

模型BaseRTllama.cpp提升MLX提升
Qwen3-0.6B530.8 tok/s386.1 tok/s1.37×398.1 tok/s1.33×
Llama 3.2-1B342.1 tok/s267.1 tok/s1.28×298.0 tok/s1.15×
Qwen3.5-2B219.6 tok/s147.1 tok/s1.49×208.7 tok/s1.05×
Llama 3.2-3B137.0 tok/s120.0 tok/s1.14×131.0 tok/s1.05×
Gemma 4-26B-A4B85.0 tok/s83.3 tok/s1.02×87.0 tok/s0.98×
Qwen3-30B-A3B105.1 tok/s96.7 tok/s1.09×97.7 tok/s1.08×
Qwen3.5-35B-A3B110.6 tok/s72.5 tok/s1.53×104.8 tok/s1.06×
Qwen3.6-35B-A3B110.7 tok/s63.1 tok/s1.75×101.9 tok/s1.09×

获取

写留言

Enable Notifications OK No thanks