快速结论
LlamaFactory 适合已经明确“基础模型在哪些任务上不足”,并拥有可授权数据、GPU 和评测方案的算法工程师与应用团队。它把模型模板、数据格式、训练阶段、PEFT、量化、分布式引擎、评测、聊天和导出整合在一套 WebUI/CLI 中,能减少为每个模型重写脚本的工作。WebUI 降低配置门槛,但不会降低微调本身的风险:错误模板、脏数据或没有对照评测,仍会得到一个看似能聊、实际退化的模型。
截至 2026-07-21,canonical 仓库是 hiyouga/LlamaFactory,最新稳定 Release 为 0.9.5,加入 Qwen3.5/3.6、Gemma 4、Transformers v5 等支持。官方 README 列出 100+ LLM/VLM、持续预训练、SFT、Reward Modeling、PPO、DPO、KTO、ORPO、SimPO,以及 Full、Freeze、LoRA、QLoRA、OFT/QOFT 等组合。支持清单只说明框架能加载和训练,不代表每个基础模型允许相同的商业用途、再分发或衍生模型发布。
核心功能
- WebUI 与 CLI:
llamafactory-cli webui提供训练、评估与预测、Chat、Export 四个界面;CLI/YAML 更适合版本控制、自动化和精确复现。 - 多阶段训练:覆盖持续预训练、多模态 SFT、奖励模型、PPO、DPO、KTO、ORPO 和 SimPO,满足知识适配、行为对齐与偏好学习。
- 多种参数更新方式:Full、Freeze、LoRA、QLoRA、OFT/QOFT,以及 DoRA、PiSSA、GaLore、BAdam 等算法,资源占用和兼容性各不相同。
- 量化与加速:支持 2/3/4/5/6/8-bit QLoRA、FlashAttention-2、Unsloth、Liger Kernel 等;每种组合都需检查 GPU、CUDA 和模型架构兼容性。
- 分布式训练:支持 DDP、DeepSpeed、FSDP/FSDP2 和 Ray;ZeRO、参数 Offload 能降低显存,但会增加通信或训练时间。
- 多模型与多模态模板:覆盖 Llama、Qwen、DeepSeek、Gemma、GLM、Mistral、Phi 等家族及图像、视频、音频任务,训练与推理必须使用匹配模板。
- 评测与导出:可载入模型与 Adapter 做评估、预测和 Chat,合并 LoRA、量化导出,并通过 vLLM/SGLang 或 OpenAI 风格 API 服务。
适合人群
- 需要对开源 LLM/VLM 做领域 SFT、偏好学习或继续预训练的算法团队。
- 希望用 WebUI 建立首个实验,再用 CLI/YAML 复现到训练平台的研发人员。
- 需要在单机多卡或多机上使用 DeepSpeed、FSDP2、Ray 的平台工程团队。
- 计划把 Adapter 或合并模型部署到 vLLM 或导出给 Ollama 的应用团队。
- 不适合没有授权训练数据、没有独立验证集、只希望“喂几份文档就永远正确”的团队;这类需求通常应先测试 RAG。
使用场景
- 领域 SFT:用经过脱敏和授权的客服、法律或产品数据训练 LoRA,并与基础模型在保留集上比较准确率与拒答行为。
- 偏好对齐:通过 DPO/KTO/ORPO 学习成对偏好,但要检查偏好数据是否把品牌语气、事实错误或安全漏洞一并固化。
- 多模态适配:对图像、视频或音频理解模型训练任务模板,确保媒体数据的肖像、版权和个人信息处理有依据。
- 低显存实验:官方估算 7B 级模型 4-bit QLoRA 约需 6GB 显存,而 16-bit Full 约需 120GB;这只是起始估算,序列长度、Batch、优化器和激活会改变占用。
- 分布式全参训练:用 DeepSpeed ZeRO-3 或 FSDP/FSDP2 分片模型、梯度与优化器状态,先在小样本完成断点续训和一致性验证。
- 训练后服务:合并 Adapter、导出模型,再交给推理后端;若只是本地试跑原模型,Transformers 或 Ollama 可能更直接。
价格与版本
LlamaFactory 框架代码采用 Apache 2.0,没有官方付费版。真实成本是 GPU 时长、数据清洗与标注、实验存储、评测、监控和上线审核。0.9.5 的依赖基线已推进到 Python 3.11 和较新的 Transformers/PyTorch 组合;升级前应固定 Git Tag、容器镜像、CUDA、依赖锁文件与数据版本,不能让 main 分支变化直接进入生产训练。
许可证必须拆开:框架代码的 Apache 2.0 只约束 LlamaFactory 本身;基础模型可能使用 Llama、Gemma、Qwen 或其他自定义条款;README 列出的每个数据集也有自己的许可、用途、地域和隐私约束;微调 Adapter、合并权重和模型输出能否商用或再发布,取决于这些上游条款及你的数据权利。发布前建立 BOM,记录基础模型、权重哈希、数据来源、许可版本、训练参数和评测结果。
国内访问与使用体验
文档和国内社区对中文用户友好,README 支持从 ModelScope 等来源下载模型。真正的摩擦通常来自 CUDA、驱动、FlashAttention、bitsandbytes 与模型模板兼容,而不是 WebUI 按钮。建议先用官方 Demo 数据跑通 llamafactory-cli version、单卡 LoRA、断点恢复、评估和导出,再引入私有数据。
训练安全需要单独设计。私有对话、工单和代码先做数据盘点、授权、去标识化和最小化,禁止把 Secret、Token、密码或未授权个人信息写入 Dataset。训练节点和实验追踪服务应隔离网络与凭据;W&B、MLflow 等外部 Logger 若开启,先确认不会上传样本、Prompt 或模型产物。对抗性样本、数据投毒、后门和隐私记忆要进入安全评测,不能只看 Loss。
优点
- WebUI 适合发现参数,CLI/YAML 适合复现和平台化,两条路径共享训练能力。
- 模型、模板、训练阶段和 PEFT 方法覆盖广,减少重复集成。
- 官方给出显存估算和分布式方案,便于在实验前筛掉明显不可行的组合。
- 支持评测、Chat、Adapter 合并与推理后端,训练后链路相对完整。
- Apache 2.0 框架便于审查和自托管,中文资料与社区活跃。
不足
- 组合矩阵很大,模型、模板、量化、后端与依赖之间并非全部可互换。
- WebUI 容易让新手跳过数据版本、命令记录、随机种子和评测设计,实验未必可复现。
- 显存估算不是保证;长上下文、多模态和高 Batch 会显著增加资源。
- 框架许可不覆盖模型、数据、Adapter 和输出,商用审核仍是使用方责任。
- 微调可能降低通用能力、安全性或事实性;没有基线对照和回归集就不应发布。
替代品对比
| 工具 | 更适合谁 | 优势 | 主要取舍 |
|---|---|---|---|
| LlamaFactory | 需要 WebUI、CLI 和多模型多算法统一入口 | 训练阶段与模板覆盖广 | 组合复杂,需严格版本管理 |
| Unsloth | 单机高效 LoRA/QLoRA 用户 | 速度和显存优化突出 | 完整训练编排范围较窄 |
| Axolotl | 偏好 YAML、CLI 和工程化训练流水线的团队 | 配置驱动、生态成熟 | 对非技术用户不如 WebUI 直观 |
| Transformers Trainer | 需要最大代码控制的研究与研发团队 | 底层灵活、生态基础 | 需自行集成模板、方法和运维 |
| Hugging Face AutoTrain | 希望使用托管式训练流程的团队 | 降低环境维护 | 数据出域、费用和自定义边界需评估 |
常见问题 FAQ
LlamaFactory 是免费的吗?
框架代码免费并采用 Apache 2.0,但 GPU、存储、数据处理和部署都有成本;基础模型与数据还可能带来额外许可限制。
WebUI 和 CLI 应该选哪个?
首个实验可用 WebUI 理解参数和流程,正式实验应导出或维护 YAML,通过 CLI 运行并记录 Git Tag、环境、数据版本和随机种子。
一张消费级显卡能微调模型吗?
可以从较小模型与 4-bit QLoRA 开始。官方对 7B 给出约 6GB 的估算,但序列长度和训练配置会改变占用,先做小 Batch 实测。
LlamaFactory 的 Apache 2.0 是否让微调模型自动可商用?
不会。基础模型许可、训练数据权利和发布方式共同决定 Adapter、合并权重与输出的使用范围。框架许可证只是其中一层。
微调私有数据会比调用云模型安全吗?
不一定。自托管减少数据出域,但训练集、Checkpoint、日志、实验平台和对象存储都会新增敏感副本。必须做权限、加密、留存和删除设计。
微调和 RAG 怎么选?
需要更新知识、可引用来源时先用 RAG;需要稳定格式、语气或任务行为时再评估微调。很多生产系统会用微调控制行为,再用 RAG 提供最新事实。
总结
LlamaFactory 把繁杂的微调组件做成了可操作的 WebUI 和可复现的 CLI,但真正决定结果的仍是数据、评测、硬件和权利链。建议从一个小模型、一个 LoRA 实验和一组冻结验证集开始,比较基础模型、RAG 与微调后的收益;只有质量提升可重复,安全回归通过,模型与数据许可证也允许,才进入合并和部署。