← 返回博客
发布v0.1.0

LoongForge v0.1.0 Release

2026-05-09 · LoongForge 团队

我们很高兴正式发布 LoongForge 首个对外版本 —— 一套模块化、可扩展、高性能的大规模 Transformer 训练框架,覆盖多种模态与架构。本次发布包含四类模态(LLM、VLM、VLA、Diffusion),并开箱支持 Pretrain / MidTrain / SFT / LoRA 全流程。

📖 文档: loongforge.readthedocs.io/zh-cn/v0.1.0

支持模型

LoongForge 提供一组开箱即用的生产级模型配置。重点列举如下,完整列表见 Supported Models 文档。

LLM

VLM

Diffusion & VLA

核心能力

⚡ 自适应 FP8 训练

面向 LLM 与 VLM 的端到端 FP8 训练,按 GEMM 形状逐算子判断是否启用 FP8 —— 在能提升吞吐处启用 FP8,对数值敏感处保留更高精度。

🔀 MoE 优化

All2All 通信激活卸载计算的重叠调度,使万亿参数 MoE 训练能在紧凑显存预算内运行,同等负载下吞吐相对上游 Megatron-LM 有改进。

🖼️ VLM 训练

OmniCombinationModel 将视觉编码器与 LLM 主干解耦为可组合组件,各侧可独立选择 TP/PP/DP 策略,由流水线调度器统一编排。替换 ViT 或 LLM 仅需改 YAML,无需改代码。

🧠 显存与计算

系统性显存优化 —— 激活卸载、重算规划、融合算子(如 FusedDSA、Sparse MLA) —— 在提升计算利用率的同时降低峰值显存占用。

💾 Checkpoint 与 LoRA

原生 HuggingFace ↔ Megatron checkpoint 转换,并通过 --save-hf true 支持在线 HuggingFace 存取。LoRA 作为一等能力:适配、训练、合并、发布一条龙。

🔧 自定义算子

高性能 CUDA/C++ 融合算子统一放在 ops/ 下,通过硬件抽象层分发 —— 同一训练脚本可透明调用 GPU 原生或 XPU 原生实现。

📦 数据管线

多模态数据管线:图像/视频处理插件、序列打包、长度均衡、数据并行负载均衡 —— 面向大规模多机训练调优。

🖥️ 异构硬件

同一套代码同时运行在 NVIDIA GPU 与百度昆仑 XPU(P800)上。首版已在两个平台上验证了主力 LLM 与 VLM 系列,硬件差异通过 models/dispatch.py 的插件化设计最小化侵入。

贡献者

感谢所有让这个版本落地的同学。除了 GitHub 上公开的贡献者(@nullnonenilNULL@VVsssssk@XueSongTap@Zachary-wW@pengxiangyu@NeverlanD0829@Dreamspr22@Yangsx-1@kaimo455),还要特别感谢20+ 位内部开发者与早期贡献者的长期投入 —— 是他们打下了 LoongForge 的底座。

反馈与问题

这是我们第一个对外版本 —— 非常欢迎社区反馈。可以通过 GitHub Issues 提出问题、提交 PR,或通过 README 中的微信开发者群联系我们。

🐉 v0.1.0 只是起点,不是终点。告诉我们下一步该建什么。
🔗 在 GitHub 查看: LoongForge v0.1.0 Release 页面
← 上一篇:LoongForge 正式开源 所有文章 →