LlamaFactory logo

LlamaFactory

★★★★½ 4.6/5
访问官网
分类
其他
定价
免费
访问
直连可用

快速结论

LlamaFactory 适合已经明确“基础模型在哪些任务上不足”,并拥有可授权数据、GPU 和评测方案的算法工程师与应用团队。它把模型模板、数据格式、训练阶段、PEFT、量化、分布式引擎、评测、聊天和导出整合在一套 WebUI/CLI 中,能减少为每个模型重写脚本的工作。WebUI 降低配置门槛,但不会降低微调本身的风险:错误模板、脏数据或没有对照评测,仍会得到一个看似能聊、实际退化的模型。

截至 2026-07-21,canonical 仓库是 hiyouga/LlamaFactory,最新稳定 Release 为 0.9.5,加入 Qwen3.5/3.6、Gemma 4、Transformers v5 等支持。官方 README 列出 100+ LLM/VLM、持续预训练、SFT、Reward Modeling、PPO、DPO、KTO、ORPO、SimPO,以及 Full、Freeze、LoRA、QLoRA、OFT/QOFT 等组合。支持清单只说明框架能加载和训练,不代表每个基础模型允许相同的商业用途、再分发或衍生模型发布。

核心功能

  • WebUI 与 CLIllamafactory-cli webui 提供训练、评估与预测、Chat、Export 四个界面;CLI/YAML 更适合版本控制、自动化和精确复现。
  • 多阶段训练:覆盖持续预训练、多模态 SFT、奖励模型、PPO、DPO、KTO、ORPO 和 SimPO,满足知识适配、行为对齐与偏好学习。
  • 多种参数更新方式:Full、Freeze、LoRA、QLoRA、OFT/QOFT,以及 DoRA、PiSSA、GaLore、BAdam 等算法,资源占用和兼容性各不相同。
  • 量化与加速:支持 2/3/4/5/6/8-bit QLoRA、FlashAttention-2、Unsloth、Liger Kernel 等;每种组合都需检查 GPU、CUDA 和模型架构兼容性。
  • 分布式训练:支持 DDP、DeepSpeed、FSDP/FSDP2 和 Ray;ZeRO、参数 Offload 能降低显存,但会增加通信或训练时间。
  • 多模型与多模态模板:覆盖 Llama、Qwen、DeepSeek、Gemma、GLM、Mistral、Phi 等家族及图像、视频、音频任务,训练与推理必须使用匹配模板。
  • 评测与导出:可载入模型与 Adapter 做评估、预测和 Chat,合并 LoRA、量化导出,并通过 vLLM/SGLang 或 OpenAI 风格 API 服务。

适合人群

  • 需要对开源 LLM/VLM 做领域 SFT、偏好学习或继续预训练的算法团队。
  • 希望用 WebUI 建立首个实验,再用 CLI/YAML 复现到训练平台的研发人员。
  • 需要在单机多卡或多机上使用 DeepSpeed、FSDP2、Ray 的平台工程团队。
  • 计划把 Adapter 或合并模型部署到 vLLM 或导出给 Ollama 的应用团队。
  • 不适合没有授权训练数据、没有独立验证集、只希望“喂几份文档就永远正确”的团队;这类需求通常应先测试 RAG。

使用场景

  • 领域 SFT:用经过脱敏和授权的客服、法律或产品数据训练 LoRA,并与基础模型在保留集上比较准确率与拒答行为。
  • 偏好对齐:通过 DPO/KTO/ORPO 学习成对偏好,但要检查偏好数据是否把品牌语气、事实错误或安全漏洞一并固化。
  • 多模态适配:对图像、视频或音频理解模型训练任务模板,确保媒体数据的肖像、版权和个人信息处理有依据。
  • 低显存实验:官方估算 7B 级模型 4-bit QLoRA 约需 6GB 显存,而 16-bit Full 约需 120GB;这只是起始估算,序列长度、Batch、优化器和激活会改变占用。
  • 分布式全参训练:用 DeepSpeed ZeRO-3 或 FSDP/FSDP2 分片模型、梯度与优化器状态,先在小样本完成断点续训和一致性验证。
  • 训练后服务:合并 Adapter、导出模型,再交给推理后端;若只是本地试跑原模型,Transformers 或 Ollama 可能更直接。

价格与版本

LlamaFactory 框架代码采用 Apache 2.0,没有官方付费版。真实成本是 GPU 时长、数据清洗与标注、实验存储、评测、监控和上线审核。0.9.5 的依赖基线已推进到 Python 3.11 和较新的 Transformers/PyTorch 组合;升级前应固定 Git Tag、容器镜像、CUDA、依赖锁文件与数据版本,不能让 main 分支变化直接进入生产训练。

许可证必须拆开:框架代码的 Apache 2.0 只约束 LlamaFactory 本身;基础模型可能使用 Llama、Gemma、Qwen 或其他自定义条款;README 列出的每个数据集也有自己的许可、用途、地域和隐私约束;微调 Adapter、合并权重和模型输出能否商用或再发布,取决于这些上游条款及你的数据权利。发布前建立 BOM,记录基础模型、权重哈希、数据来源、许可版本、训练参数和评测结果。

国内访问与使用体验

文档和国内社区对中文用户友好,README 支持从 ModelScope 等来源下载模型。真正的摩擦通常来自 CUDA、驱动、FlashAttention、bitsandbytes 与模型模板兼容,而不是 WebUI 按钮。建议先用官方 Demo 数据跑通 llamafactory-cli version、单卡 LoRA、断点恢复、评估和导出,再引入私有数据。

训练安全需要单独设计。私有对话、工单和代码先做数据盘点、授权、去标识化和最小化,禁止把 Secret、Token、密码或未授权个人信息写入 Dataset。训练节点和实验追踪服务应隔离网络与凭据;W&B、MLflow 等外部 Logger 若开启,先确认不会上传样本、Prompt 或模型产物。对抗性样本、数据投毒、后门和隐私记忆要进入安全评测,不能只看 Loss。

优点

  • WebUI 适合发现参数,CLI/YAML 适合复现和平台化,两条路径共享训练能力。
  • 模型、模板、训练阶段和 PEFT 方法覆盖广,减少重复集成。
  • 官方给出显存估算和分布式方案,便于在实验前筛掉明显不可行的组合。
  • 支持评测、Chat、Adapter 合并与推理后端,训练后链路相对完整。
  • Apache 2.0 框架便于审查和自托管,中文资料与社区活跃。

不足

  • 组合矩阵很大,模型、模板、量化、后端与依赖之间并非全部可互换。
  • WebUI 容易让新手跳过数据版本、命令记录、随机种子和评测设计,实验未必可复现。
  • 显存估算不是保证;长上下文、多模态和高 Batch 会显著增加资源。
  • 框架许可不覆盖模型、数据、Adapter 和输出,商用审核仍是使用方责任。
  • 微调可能降低通用能力、安全性或事实性;没有基线对照和回归集就不应发布。

替代品对比

工具更适合谁优势主要取舍
LlamaFactory需要 WebUI、CLI 和多模型多算法统一入口训练阶段与模板覆盖广组合复杂,需严格版本管理
Unsloth单机高效 LoRA/QLoRA 用户速度和显存优化突出完整训练编排范围较窄
Axolotl偏好 YAML、CLI 和工程化训练流水线的团队配置驱动、生态成熟对非技术用户不如 WebUI 直观
Transformers Trainer需要最大代码控制的研究与研发团队底层灵活、生态基础需自行集成模板、方法和运维
Hugging Face AutoTrain希望使用托管式训练流程的团队降低环境维护数据出域、费用和自定义边界需评估

常见问题 FAQ

LlamaFactory 是免费的吗?

框架代码免费并采用 Apache 2.0,但 GPU、存储、数据处理和部署都有成本;基础模型与数据还可能带来额外许可限制。

WebUI 和 CLI 应该选哪个?

首个实验可用 WebUI 理解参数和流程,正式实验应导出或维护 YAML,通过 CLI 运行并记录 Git Tag、环境、数据版本和随机种子。

一张消费级显卡能微调模型吗?

可以从较小模型与 4-bit QLoRA 开始。官方对 7B 给出约 6GB 的估算,但序列长度和训练配置会改变占用,先做小 Batch 实测。

LlamaFactory 的 Apache 2.0 是否让微调模型自动可商用?

不会。基础模型许可、训练数据权利和发布方式共同决定 Adapter、合并权重与输出的使用范围。框架许可证只是其中一层。

微调私有数据会比调用云模型安全吗?

不一定。自托管减少数据出域,但训练集、Checkpoint、日志、实验平台和对象存储都会新增敏感副本。必须做权限、加密、留存和删除设计。

微调和 RAG 怎么选?

需要更新知识、可引用来源时先用 RAG;需要稳定格式、语气或任务行为时再评估微调。很多生产系统会用微调控制行为,再用 RAG 提供最新事实。

总结

LlamaFactory 把繁杂的微调组件做成了可操作的 WebUI 和可复现的 CLI,但真正决定结果的仍是数据、评测、硬件和权利链。建议从一个小模型、一个 LoRA 实验和一组冻结验证集开始,比较基础模型、RAG 与微调后的收益;只有质量提升可重复,安全回归通过,模型与数据许可证也允许,才进入合并和部署。

最后更新:2026年7月21日

同类工具推荐