ONLINE RL
DiffusionNFT
保留最终 x0 与奖励,再通过 forward noising 计算 flow-matching optimality loss。
POINTWISE
r(x0) → pi → LNFT
THE OPERATING SYSTEM
训练不是一个脚本,而是一组必须同时成立的事实。
Multimodal Trainer 把版本化配方、模型实现、受控启动、指标、checkpoint 和人工评测连接到同一个运行身份。
INPUT / 01
数据来源、参考图、顺序、随机种子和起始权重进入同一份可校验配置。
MODEL WORKBENCH
ONLINE RL
保留最终 x0 与奖励,再通过 forward noising 计算 flow-matching optimality loss。
FOUNDATION
原生图像编辑、蒸馏与模型专属数据管线。
PREFERENCE
成对偏好训练与图像模型 FSDP2 候选配置。
MODEL LINES
共享工程入口,保持 scheduler、conditioning 与权重语义彼此隔离。
CONTROL PLANE
网页负责看,MCP 负责提案、确认与发动。
REAL PRODUCT EVIDENCE
WebTrainer Studio 把训练配置、运行状态、数据、指标、媒体和权重关系放进同一视图。
CHECKPOINT LINEAGE
能读取、能续训、训练健康和质量晋级是四件不同的事。Multimodal Trainer 让每一步留下独立证据。
阅读事实源说明START FROM SOURCE