恶补大模型基础ingpaperhttps://arxiv.org/pdf/2509.16117v2codehttps://github.com/NVlabs/DiffusionNFT核心方法Diffusion Negative-aware FineTuning扩散模型负样本感知微调发表情况ICLR 2026 Oral。这篇论文要解决的核心问题是怎样像训练大语言模型一样利用在线强化学习持续优化扩散模型但又不必计算扩散模型难以处理的生成概率作者的答案不再把扩散模型的反向生成轨迹看作强化学习轨迹而是先生成完整图像、获得奖励再把高奖励和低奖励图像重新放回标准的前向加噪训练过程通过“靠近正样本、远离负样本”完成策略改进。所以DiffusionNFT虽然被称为“扩散强化学习”但它的训练形式更接近一种带有正负奖励权重的在线监督学习。intro简单理解假设扩散模型针对同一个提示词生成了24张图画得好的图奖励高画得差的图奖励低传统RFT只拿好图继续训练DiffusionNFT不仅学习好图还利用差图告诉模型“不要往这个方向生成”。更准确地说DiffusionNFT构造了两个隐式模型一个隐式正策略用来靠近高奖励图像一个隐式负策略用来拟合低奖励图像但由于其中采用了反向参数化最终会把真实模型推离低奖励方向。这就是名称中Negative-aware的含义。为什么扩散模型很难直接套用 PPO、GRPO大语言模型为什么容易做策略梯度自回归语言模型生成一个序列y(y1​,y2​,…,yL​)它的概率可以直接写成因此每个词的对数概率都可以计算PPO或GRPO可以构造从而判断新模型相对于旧模型把一个动作的概率提高了多少。扩散模型的问题在哪里扩散模型不是一步一步选择离散词元而是从噪声逐渐变成图像xT→xT−1→⋯→x1→x0。最终图像分布的精确似然πθ(x0∣c) 通常不能低成本、精确地计算。虽然可以通过概率流ODE、ELBO或离散SDE转移进行近似但计算复杂而且会引入近似偏差。因此现有方法通常把扩散采样离散成一个多步MDP状态当前噪声图像 xt​动作生成下一个状态 xt−Δtxt−Δt​奖励最终图像 x0 的质量策略相邻扩散步的高斯转移分布。FlowGRPO就是这种路线。它通过给原本确定性的流模型加入随机噪声把相邻扩散状态之间的转移变成可计算概率的高斯分布然后再套用GRPO。雷达图比较SD3.5-M无CFGSD3.5-M有CFGFLUX.1-DevDiffusionNFT优化后的SD3.5-M无CFG。评估包括GenEvalOCRPickScoreCLIPScoreHPSv2.1AestheticImageRewardUnifiedReward。DiffusionNFT在各个轴上都明显扩大说明不仅训练奖励得到提升若干未直接作为最终阶段训练目标的指标也有改善。图2DiffusionNFT和FlowGRPO究竟有什么区别上半部分GRPO/PPO的反向过程强化学习xT​→x2​→x1​→x0​这是扩散模型真正生成图像的反向过程。为了执行GRPO算法必须保留(xT​,xT−1​,…,x1​,x0​)也就是完整采样轨迹。随后计算每一步的新旧策略概率πθ​(xt​∣xt1​), πold​(xt​∣xt1​)最后把终点奖励 r(x0​) 分配给整条轨迹。这里有三个问题。必须使用能够提供高斯转移概率的随机采样器。原本流模型常用ODE采样但ODE是确定性的。给定 xt​下一个状态几乎唯一难以直接构造GRPO所需的普通概率密度。所以FlowGRPO必须引入SDE噪声。训练被特定采样器绑定。采样时怎样离散、加入多少随机噪声都会影响训练时的概率比。模型训练和采样器不再独立。需要保存整条轨迹。不仅保存最终图片 x0​还要保存大量中间状态显存和存储开销较大。图2下半部分DiffusionNFT的前向过程强化学习DiffusionNFT的过程是使用任意黑盒采样器生成最终图像 x0​计算最终奖励r(x0​)只保存提示词、完整图像和奖励训练时重新对 x0​ 加噪得到 xt​用标准Flow Matching损失更新模型。也就是说它不关心图像是怎样被生成出来的。无论使用一阶ODE/二阶ODE/SDE/DDIM/DPM-Solver/其他黑盒求解器最终只要得到 x0​都能用于训练。因此这里的“在前向过程上做RL”不是说前向加噪本身在执行决策而是说强化信号最终被注入标准前向加噪和Flow Matching训练目标而不是注入反向采样轨迹的概率梯度。论文称其具有求解器无关、无需保存轨迹、无似然估计和原生离策略等特点。前向加噪过程xtαtx0σtϵϵ∼N(0,I)对应的条件分布是通俗地说给定一张干净图像可以直接在任何时刻 t 构造它的带噪版本而不必一步一步加噪。速度预测论文采用速度参数化这里的点表示关于时间的导数模型学习vθ​(xt​,t)。其含义是给定当前带噪状态 xt​预测这条扩散轨迹在当前时刻应该沿什么方向运动。标准Flow Matching损失这就是普通的监督学习输入是 xt​ 和时间 t标签是解析得到的真实速度 v模型预测 vθ​两者用均方误差比较。其中 w(t) 控制不同噪声时间的重要性。Rectified Flow的特殊情况SD3.5采用与Rectified Flow相关的参数化。论文令αt​1−t,σt​t于是xt​(1−t)x0​tϵ也就是干净图像和高斯噪声之间的直线插值。对应速度为这时真实速度在整条直线路径上保持不变。模型训练后可以解下面的ODE生成图像采样时从噪声端 t1积分到图像端 t0。methodFlowGRPO为什么必须引入SDE随机微分方程其中vθ​原本的确定性速度gt​随机噪声强度dwt​布朗运动增量第一部分是漂移项第二部分是随机扩散项。论文用当它经过Euler离散后相邻状态满足高斯分布这样才能计算每一步的对数概率进而应用PPO或GRPO。这正是DiffusionNFT想绕开的复杂环节。DiffusionNFT怎样定义“正样本”和“负样本”设当前采样策略为其中 c 是文本提示词。对同一个提示词生成 K 张图像每张图像获得奖励论文把这个奖励解释成一个“最优概率”o1该图像被视为正样本o0该图像被视为负样本。主要是一个理论上的概率分割方式。正策略分布相当于对旧策略生成的图像按照奖励 r 重新加权奖励越高权重越大奖励接近0几乎不会进入正分布。负策略分布它按照 1−r 加权奖励越低权重越大奖励越高越不容易进入负分布。为什么正分布一定比旧策略好即正策略优于旧策略旧策略优于负策略。这也是为什么只在正样本上做Rejection Fine-Tuning理论上也能提高奖励。但是论文发现扩散模型只用正样本训练容易迅速崩溃所以进一步引入了负样本把强化学习写成“引导方向”论文定义目标速度其中vold当前旧策略的速度场Δ强化引导方向1/β引导强度。这和CFG的结构很相似新预测基础预测引导强度×引导方向。区别是CFG的方向来自条件模型与无条件模型之差DiffusionNFT的方向来自正策略、旧策略和负策略之间的差异。这里要特别注意在这篇论文的定义中实际引导强度与 1/β 成正比因此 β 越小更新越激进而不是越保守。改进方向是怎样推导出来的图3画出了三个速度场蓝色 v−负策略速度紫色 vold旧策略速度红色 v正策略速度黑色虚线 Δ强化引导方向。论文定义这个量可以理解为即观察到当前噪声状态 xt​ 后它源自正分布的后验概率。因此α(xt​) 越接近1当前状态越像正样本α(xt​) 越接近0当前状态越像负样本。旧策略是正负策略的局部混合扩散模型的最优速度预测本质上与后验均值有关因此论文证明这就是ep(4):这个公式的直观意义从负策略看:即从负策略方向指向旧策略方向。继续沿这个方向运动就是远离低奖励区域。从正策略看即从旧策略指向正策略。沿这个方向运动就是靠近高奖励区域。因此负样本和正样本不是给出两个相互冲突的更新方向而是从两侧共同确定同一个改进方向。这就是图3中黑色虚线的含义。为什么取特定的引导强度能得到正策略也就是说恰当选择引导强度可以直接把旧策略移动到正策略。但实践中 α(xt​) 很难准确获得而且随 xt​ 变化所以论文后面使用固定超参数 β并通过隐式正负策略构造近似改进方向。左侧旧策略生成图像给定条件“a cute dog”中间重新加噪对最终图像重新执行前向过程xt​αt​x0​σt​ϵ于是得到标准Flow Matching训练样本(xt​,c,t,v,r)。此时已经不需要原来的反向生成轨迹。右侧两个隐式策略分支同一个待训练模型 vθ​ 与旧模型 vold 组合成隐式正策略 vθ​隐式负策略 vθ−​。两个分支分别计算扩散重建损失最后通过 r 和 1−r 加权。最终只更新一个模型 vθ​而不是保存两个独立网络。核心loss正样本分支在做什么负样本分支为什么不是学习坏图单个样本对 vθ​ 的梯度为正样本分支前面是正号表现为普通拟合。负样本分支前面出现负号因此对低奖励样本执行的是相反方向更新。这正是Negative-aware的计算本质。初始化预训练参考模型vref采样模型初始化为vold←vref训练模型初始化为vθ​←vref数据缓冲区D←∅这里同时保存两个模型副本vold负责生成数据vθ​负责梯度更新。Rollout阶段梯度阶段在线更新阶段experiment图7为什么ODE采样优于SDE比较一阶SDE一阶ODE二阶ODE。结果显示在GenEval上二阶ODE略优于一阶ODE在PickScore上两种ODE接近SDE整体较差尤其是PickScore。原因是DiffusionNFT生成的图像既要用于评分又要作为后续训练数据。SDE引入的额外随机噪声可能降低图像质量使奖励模型给出较低或更不稳定的评分。ODE采样生成结果更确定、更干净更适合成为在线训练数据。这张图也验证了论文的一个关键观点求解器自由不仅是形式上的优点能够使用高质量ODE求解器确实改善了在线数据质量和训练表现。为什么需要对采样策略做软更新其中ηi​0旧模型立刻等于当前训练模型完全on-policyηi​→1旧模型变化很慢更接近离线训练。论文观察到完全on-policy早期提升快但容易发生灾难性崩溃ηη 太大虽然稳定但新数据长期来自落后模型收敛很慢较好的做法是早期 ηη 小后期逐渐增大。直观上这是在平衡两个目标让采样模型及时跟上训练模型不让训练数据分布变化得过快。图8比较了几种 ηiηi​ 设置。包含ηi0ηimin⁡(0.001i,0.5)ηimin⁡(0.01i,0.8)ηi​0.9完全on-policy初期奖励快速上升但后期出现明显不稳定。原因是训练模型一更新采样分布立即跟随变化形成过强的自反馈模型轻微偏移→生成数据改变→奖励分布改变→模型继续偏移固定 η0.9曲线十分缓慢。因为采样模型长期停留在旧参数附近训练模型难以快速获得更优样本。逐渐增大的EMA初期允许采样模型快速追随后期加强平滑是论文推荐的策略。总之最重要的思想不是某一个技巧而是扩散模型的在线强化学习未必一定要在反向生成轨迹上做策略梯度。完整生成结果及其奖励也可以被重新转化为标准前向扩散监督数据并利用正负策略的几何关系完成策略改进。从研究视角看DiffusionNFT打通了三件事在线采样奖励反馈标准Flow Matching训练。既保留了强化学习“模型生成—环境评价—继续改进”的闭环又尽量复用了扩散模型最成熟、最稳定的监督训练框架。这正是它能够显著提高训练效率同时摆脱轨迹似然和特定SDE采样器约束的根本原因。