1.下载模型文件
https://hf-mirror.com/mlx-community/models?search=qwen3.5
https://modelscope.cn/models?name=qwen
找到需要下载的模型,模型数据默认缓存在:/Users/peile.duan/.cache/huggingface/hub/,可通过–local-dir指定下载路径。具体命令如下:
uv pip install huggingface_hub
export HF_ENDPOINT=https://hf-mirror.com
hf download Qwen/Qwen2.5-0.5B-Instruct --local-dir ./models/Qwen2.5-0.5B-Instruct
uv pip install modelscope
modelscope download --model Qwen/Qwen3.5-9B --local-dir ./models/Qwen3.5-9B
2.模型格式说明
2.1 格式对比
2.1.1 信息组成
一个”能用的大模型”至少包含 4 部分信息:
|
组成 |
说明 |
|
① 权重 |
几十亿个浮点数,占体积 99%+ |
|
② 计算图/架构 |
这些权重怎么组织成 Transformer,RoPE 怎么算,Attention 怎么连 |
|
③ 超参数 |
层数、隐藏维度、head 数、词表大小、RoPE base…… |
|
④ Tokenizer |
词表、merges、特殊 token、chat template |
各种格式的本质区别,就是这 4 样东西”放在哪里”。
|
格式 |
本质 |
计算图在哪 |
权重存储 |
典型体积(7B) |
|
Transformers (safetensors) |
权重字典 + Python 代码 |
Python 库 |
safetensors |
~14 GB |
|
GGUF |
自描述单文件 |
C++ 代码 (llama.cpp) |
内嵌 |
~14 GB (F16) / ~4 GB (Q4) |
|
ONNX |
Protobuf 计算图 |
文件内 |
内嵌/外置 |
~14 GB |
|
MLX |
HF 结构 + Apple 重排 |
MLX 库 |
safetensors |
~14 GB / ~4 GB (4bit) |
|
TensorRT-LLM (.engine) |
AOT 编译产物 |
编译进二进制 |
内嵌 |
~7 GB (FP8) |
|
OpenVINO IR |
XML 图 + bin 权重 |
文件内 |
.bin |
~14 GB |
|
CoreML (.mlpackage) |
Apple 编译产物 |
内嵌 |
内嵌 |
~7 GB |
|
GPTQ / AWQ |
HF 格式 + 量化打包 |
Python 库 |
safetensors (int4) |
~4 GB |
|
EXL2 / EXL3 |
可变比特率量化 |
ExLlamaV2 代码 |
safetensors |
~3.5 GB |
|
TFLite / ExecuTorch |
移动端编译图 |
内嵌 |
内嵌 |
~4 GB (int8) |
2.1.2 应用场景
HF/Transformers 格式是唯一的”母版”(能训练、生态最全);GGUF 是为消费级本地推理做的单文件自包含分发格式;ONNX 是为跨框架跨硬件设计的自描述计算图;TensorRT/CoreML 之类是针对特定硬件的预编译产物。
|
核心场景 |
最佳格式 |
推荐理由与关键原则 |
|
1. 模型训练与微调 |
Transformers (Safetensors) |
唯一源头。 所有其他格式都从它转换而来。生态最全(Trainer, TRL, LoRA),必须用这种格式才能“修改模型”。 |
|
2. Mac本地极速推理 |
MLX (Safetensors) |
苹果专属引擎。 文件结构与 Transformers 一样,但内部权重已针对 Apple GPU 重新排列。调用 即可无缝调用 Metal 加速。 |
|
3. Mac/端侧“开箱即用” |
GGUF |
单文件分发王。 一个 文件打包了权重、配置、分词器。配合 Ollama/LM Studio 即开即用,最爱消费级硬件。 |
|
4. CPU服务器/跨平台部署 |
ONNX |
跨框架万能胶。 针对非 NVIDIA 硬件或纯 CPU 环境优化最好, 生态成熟,适合 Embedding 或轻量级模型。 |
|
5. 向量检索/语义匹配 |
Sentence-Transformers |
专用流水线。 这是一种特殊文件结构(含 等),直接输出语义向量而非文本,是 RAG 系统的基石。 |
|
6. 手机/浏览器/IoT |
MediaPipe / TFLite / ExecuTorch |
AOT编译产物。 需将模型预编译为针对特定硬件(如苹果神经引擎ANE)的二进制文件,体积和功耗极低,但灵活性最差,不通用。 |
|
7. 纯NVIDIA生产环境 |
TensorRT-LLM Engine |
特化编译王。 针对特定 GPU 型号和 batch size 深度优化。性能天花板极高,但必须“换一张卡就重编一次”,不适合个人实验。 |
|
8. 模型安全分发 |
Safetensors |
通用容器标准。 它不是独立格式,而是安全的权重容器。无论你搞 TF、PyTorch 还是 MLX,只要看到 ,就知道加载又快又防病毒。 |
2.2 标准Transformers模型文件说明
(AI) peile.duan@U-7K6V5HCV-0153 AI % ls -rlt models/Qwen3.5-9B-MLX-4bit/
total 11674032
-rw-r--r-- 1 peile.duan staff 600449850 8 6 22:38 model-00002-of-00002.safetensors
-rw-r--r-- 1 peile.duan staff 1954 8 6 22:38 README.md
-rw-r--r-- 1 peile.duan staff 19989343 8 6 22:38 tokenizer.json
-rw-r--r-- 1 peile.duan staff 3331 8 6 22:38 config.json
-rw-r--r-- 1 peile.duan staff 1300 8 6 22:38 processor_config.json
-rw-r--r-- 1 peile.duan staff 5349771222 8 6 22:38 model-00001-of-00002.safetensors
-rw-r--r-- 1 peile.duan staff 1139 8 6 22:38 tokenizer_config.json
-rw-r--r-- 1 peile.duan staff 6722759 8 6 22:38 vocab.json
-rw-r--r-- 1 peile.duan staff 385 8 6 22:38 video_preprocessor_config.json
-rw-r--r-- 1 peile.duan staff 390 8 6 22:38 preprocessor_config.json
-rw-r--r-- 1 peile.duan staff 123592 8 6 22:38 model.safetensors.index.json
-rw-r--r-- 1 peile.duan staff 7756 8 6 22:38 chat_template.jinja