LOSS · 损失
训练损失(交叉熵)。越低越好,衡量模型预测与真实文本的差距。8K 适应初期高、随步数下降即收敛正常。
TOKENS·本步
最近一个采样窗口(5 步)处理的总 token 数 = 吞吐 × 每步秒数。反映这批数据的规模。
TOKENS·累计
训练至今累计"看过"的 token 量(B=十亿)。越大说明模型见过的语料越多。
AVG TOK/S · 吞吐
平均每秒处理 token 数。越高说明算力利用越好;2 卡 8K 序列下约 250 tok/s 为正常水平。
PEAK VRAM · 显存
峰值显存占用(GB)。监控是否逼近 DCU 容量;接近上限有 OOM 风险,当前 9.17G 很安全。
GRAD NORM · 梯度范数
参数更新的总幅度。突变/飙升可能梯度爆炸或不稳;过大可加梯度裁剪。
LR · 学习率
每步更新步长。先 warmup 升到峰值 5e-7 再恒定;太小收敛慢、太大易震荡。
ETA · 预计完成
剩余时间 = 每步秒数 × 剩余步数 ÷ 当前步。随最近一步耗时滚动更新。
主曲线 · 切换指标
上方 5 个按钮分别看 LOSS/GRAD NORM/LR/TOK-S/PEAK,可切 linear/log 轴与 smoothing 平滑。log 轴适合看跨数量级指标(如 LR)。
电费估算
按 整机≈0.8kW × 运行时长 × ¥0.7/度 估算(DCU 满载 + CPU/内存/平台)。仅为成本直观参考,非实际账单。