LoongForge v0.1.0 Release
我们很高兴正式发布 LoongForge 首个对外版本 —— 一套模块化、可扩展、高性能的大规模 Transformer 训练框架,覆盖多种模态与架构。本次发布包含四类模态(LLM、VLM、VLA、Diffusion),并开箱支持 Pretrain / MidTrain / SFT / LoRA 全流程。
📖 文档: loongforge.readthedocs.io/zh-cn/v0.1.0
支持模型
LoongForge 提供一组开箱即用的生产级模型配置。重点列举如下,完整列表见 Supported Models 文档。
LLM
- LLaMA 2 / 3
- Qwen 2 / 2.5 / 3
- DeepSeek V2 / V3 / R1
- MiniMax
- GLM-4
- MIMO
VLM
- Qwen-VL / Qwen2-VL / Qwen2.5-VL
- InternVL 2 / 2.5
- ERNIE-4.5-VL
- LLaVA-OneVision-1.5
Diffusion & VLA
- WAN 2.2(视频 diffusion)
- Pi0.5(视觉-语言-动作)
核心能力
⚡ 自适应 FP8 训练
面向 LLM 与 VLM 的端到端 FP8 训练,按 GEMM 形状逐算子判断是否启用 FP8 —— 在能提升吞吐处启用 FP8,对数值敏感处保留更高精度。
🔀 MoE 优化
All2All 通信、激活卸载与计算的重叠调度,使万亿参数 MoE 训练能在紧凑显存预算内运行,同等负载下吞吐相对上游 Megatron-LM 有改进。
🖼️ VLM 训练
OmniCombinationModel 将视觉编码器与 LLM 主干解耦为可组合组件,各侧可独立选择 TP/PP/DP 策略,由流水线调度器统一编排。替换 ViT 或 LLM 仅需改
YAML,无需改代码。
🧠 显存与计算
系统性显存优化 —— 激活卸载、重算规划、融合算子(如 FusedDSA、Sparse MLA) —— 在提升计算利用率的同时降低峰值显存占用。
💾 Checkpoint 与 LoRA
原生 HuggingFace ↔ Megatron checkpoint 转换,并通过 --save-hf true 支持在线 HuggingFace 存取。LoRA
作为一等能力:适配、训练、合并、发布一条龙。
🔧 自定义算子
高性能 CUDA/C++ 融合算子统一放在 ops/ 下,通过硬件抽象层分发 —— 同一训练脚本可透明调用 GPU 原生或 XPU 原生实现。
📦 数据管线
多模态数据管线:图像/视频处理插件、序列打包、长度均衡、数据并行负载均衡 —— 面向大规模多机训练调优。
🖥️ 异构硬件
同一套代码同时运行在 NVIDIA GPU 与百度昆仑 XPU(P800)上。首版已在两个平台上验证了主力 LLM 与 VLM 系列,硬件差异通过
models/dispatch.py 的插件化设计最小化侵入。
贡献者
感谢所有让这个版本落地的同学。除了 GitHub 上公开的贡献者(@nullnonenilNULL、@VVsssssk、@XueSongTap、@Zachary-wW、@pengxiangyu、@NeverlanD0829、@Dreamspr22、@Yangsx-1、@kaimo455),还要特别感谢20+ 位内部开发者与早期贡献者的长期投入 —— 是他们打下了 LoongForge 的底座。
反馈与问题
这是我们第一个对外版本 —— 非常欢迎社区反馈。可以通过 GitHub Issues 提出问题、提交 PR,或通过 README 中的微信开发者群联系我们。
🐉 v0.1.0 只是起点,不是终点。告诉我们下一步该建什么。