ChatLix v2

8K 上下文适应 · 训练直播
LIVE –
ChatLix v2 · 8K-CTX SFT
in progress · step –
–
STARTED
–
ELAPSED
–
电费估算
–
–
LOSS –
–
TOKENS·本步
–
TOKENS·累计
–
AVG TOK/S
–
PEAK VRAM
–
GRAD NORM
–
LR
–
ETA
–
training metrics
–
训练配置 config
基座 BASEsft_ctx4k_out/final 序列长度 SEQ8192 学习率 LR5e-7 注意力 ATTNchunked (SWA 关) RoPE×2 外推 4K→8K 算力2× 海光 DCU gfx906 数据xiaoli_sft (85% 长文档)
事件公告 notices
–
直播已上线,等待训练机数据…
实时日志 feed
等待数据…
指标名词解释 what each chart means
LOSS · 损失
训练损失(交叉熵)。越低越好,衡量模型预测与真实文本的差距。8K 适应初期高、随步数下降即收敛正常。
TOKENS·本步
最近一个采样窗口(5 步)处理的总 token 数 = 吞吐 × 每步秒数。反映这批数据的规模。
TOKENS·累计
训练至今累计"看过"的 token 量(B=十亿)。越大说明模型见过的语料越多。
AVG TOK/S · 吞吐
平均每秒处理 token 数。越高说明算力利用越好;2 卡 8K 序列下约 250 tok/s 为正常水平。
PEAK VRAM · 显存
峰值显存占用(GB)。监控是否逼近 DCU 容量;接近上限有 OOM 风险,当前 9.17G 很安全。
GRAD NORM · 梯度范数
参数更新的总幅度。突变/飙升可能梯度爆炸或不稳;过大可加梯度裁剪。
LR · 学习率
每步更新步长。先 warmup 升到峰值 5e-7 再恒定;太小收敛慢、太大易震荡。
ETA · 预计完成
剩余时间 = 每步秒数 × 剩余步数 ÷ 当前步。随最近一步耗时滚动更新。
主曲线 · 切换指标
上方 5 个按钮分别看 LOSS/GRAD NORM/LR/TOK-S/PEAK,可切 linear/log 轴与 smoothing 平滑。log 轴适合看跨数量级指标(如 LR)。
电费估算
按 整机≈0.8kW × 运行时长 × ¥0.7/度 估算(DCU 满载 + CPU/内存/平台)。仅为成本直观参考,非实际账单。