Interactive Learning Lab

大模型参数高效微调
参数量与显存占用可视化

用可计算、可观察的方式理解:为什么冻结大模型主体,只训练低秩增量,就能让 LoRA 与 QLoRA 大幅降低微调门槛。

Transformer 规模估算 LoRA 低秩分解 显存预算判断 实时对数比较

小程序说明

本小程序用于展示大模型全参数微调与参数高效微调之间的参数量和显存占用差异。你可以调节 Transformer 层数、隐藏维度、FFN 维度、LoRA rank、微调方式、数值精度和显卡预算。系统会实时计算 模型总参数量、可训练参数量、可训练比例、压缩倍数和估算显存,并通过矩阵图与柱状图解释 LoRA 如何在冻结模型主体参数的情况下,以较少的新增参数完成模型适配。

如何使用

  1. 选择模型预设,或手动调整模型结构。
  2. 选择 Full、Head-only、LoRA 或 QLoRA。
  3. 改变 rank,观察低秩矩阵与参数量变化。
  4. 选择精度和显卡预算,检查训练可行性。
  5. 结合图表、参数表与公式理解成本差异。
Σ模型总参数量
教学近似估算
Δ可训练参数量
当前微调方式
%可训练参数占比
可训练参数 ÷ 模型总参数
×参数压缩倍数
相对全参数微调
估算训练显存
含 1.2× 安全系数
显卡预算判断
i LoRA 冻结基础模型权重,只训练低秩增量矩阵 A 与 B。

低秩矩阵分解

单个 d_model × d_model 线性矩阵的更新量对比

ΔW = B × A
LoRA 的核心思想是冻结原始权重 W,只训练低秩增量 ΔW = B × A。rank r 越小,新增参数越少。

可训练参数对比

四种微调方式的数量级差异

log₁₀ scale
为避免小数值被“大柱子”吞没,柱状图使用对数缩放;柱顶仍显示真实参数量。

显存预算仪表

当前训练显存估算与所选显卡预算的关系

超出预算
0% 80% · 建议线 100%
/ 估算占用 / GPU 预算
模型权重与训练状态
激活显存(粗略)
安全冗余系数 1.20×

参数组成表

模型结构参数的近似拆解

组成部分 计算说明 参数量
Embedding vocab × d_model
Attention L × 4 × d_model²
FFN
LayerNorm L × 4 × d_model
总参数量 以上组成之和
当前可训练参数

当前计算路径

把结果与公式对应起来

总参数量 Embedding + L × (Attention + FFN + Norm)
单个注意力矩阵的 LoRA 参数 2 × r × d_model = —
当前 LoRA 可训练参数 L × 每层 LoRA 参数 = —
当前显存估算 1.2 × (训练状态 + 激活) = —

常见问题解答

本模块用于解释小程序中涉及的基础概念。点击下方问题按钮,可以查看模型结构、LoRA、QLoRA、QKV、FFN、显存估算等概念说明。

已复制当前配置摘要
📊 已访问