【论文学习】Frontiers in Physics 2024 || Cap2Seg:基于文本描述生成的 COVID-19 医学图像分割性能提升方法
Cap2SegCap2Seg: leveraging caption generation for enhanced segmentation of COVID-19 medical imagesFrontiers in Physics 2024Cap2Seg基于文本描述生成的 COVID-19 医学图像分割性能提升方法Cap2Seg 不在推理时接收医生报告而是根据图像自己生成一段医学描述再利用这段“内部生成文本”辅助病灶分割。现有语言引导医学分割存在两个问题推理阶段依赖图像—文本对 例如 LViT 训练和测试时都需要图像及对应报告。如果测试时没有报告性能会下降。文本可能不准确 医疗报告或模型生成的文本可能包含错误、无关或误导信息直接融合可能损害分割结果。Cap2Seg 的解决思路是医学图像 ↓ 同时提取视觉特征并生成医学描述 ↓ 根据图像判断生成文本中哪些词可信 ↓ 用筛选后的文本特征辅助图像分割所以它的输入只有图像输出同时包括病灶分割掩码对应的医学文本描述。Cap2Seg 主要由四个模块组成MSDFE双流编码器它包含两个并行分支CNN分支提取纹理、边缘、局部病灶信息Transformer分支提取全局结构和长距离依赖。前两个编码阶段两个分支独立工作后两个阶段开始交互和融合。其作用类似于混合 CNN-Transformer 编码器为文本生成和分割同时提供特征。MSECM语义增强与文本生成它把编码特征分成两个方向VSE利用不同膨胀率卷积提取多尺度视觉特征服务于分割TSE使用 Transformer 优化语义特征再通过 LSTM 逐词生成医学描述生成文本的监督来自数据集中的真实文本使用交叉熵损失训练SATaM抗误导文本的核心模块它用不同尺度的图像特征给文本中的词分配权重与病灶区域匹配的词获得高权重无关或可能错误的词获得低权重不同编码尺度分别产生一个视觉感知的句子特征。本质上是计算“每个词和每个图像位置的相关性”再根据整幅图像的响应重新加权文本论文还设计了 Semantic Consistency Loss约束不同尺度产生的句子特征保持一致浅层图像特征关注的文本语义 ≈ 中层图像特征关注的文本语义 ≈ 深层图像特征关注的文本语义这样可以避免某个尺度受到错误生成词的过度影响LAVD语言感知分割解码器视觉特征作为 Query经过 SATaM 处理的语言特征作为 Key 和 Value通过跨模态注意力为每个像素寻找相关文本信息。融合后的特征经过四级上采样输出最终病灶掩码。损失函数总损失由两部分组成Ltotal αLseg βLgen其中分割损失为Lseg 0.5 × BCE 0.5 × Dice Loss λ × Semantic Consistency Loss因此它属于“图像分割 医学文本生成”的多任务学习框架实验结果使用两个数据集QaTa-COV195,716训练、1,429验证、2,113测试MosMedData2,183训练、273验证、273测试。数据集mIoUDiceQaTa-COV1971.61%81.32%MosMedData63.02%75.87%在 QaTa-COV19 上LViT 使用真实文本Dice 83.66%LViT 使用生成文本Dice 78.17%Cap2Seg 不需要外部文本Dice 81.32%所以 Cap2Seg 没有超过“使用真实文本的 LViT”但明显优于 LViT 使用生成文本或不使用文本的情况。在 MosMedData 上Cap2Seg 的 Dice 75.87%高于 LViT 使用真实文本的74.57%。结构Dice基础模型72.83%加 MSDFE74.18%加 MSECM74.86%完整模型75.87%完整模型去掉 SCloss74.92%摘要引入医学文本标注可以弥补图像数据在质量上的不足从而有效缓解医学图像分割所面临的局限。现有许多方法通过将文本信息融入图像模态来获得高质量的分割结果。然而为了维持模型性能这些方法在推理阶段通常需要相互匹配的图像—文本对当缺少对应的文本标注时模型性能便会下降。此外这些方法通常假设输入的文本标注是理想且准确的而忽略了在实际应用场景中低质量文本可能对模型性能造成的不利影响。为解决上述问题我们提出了一种新的生成式医学图像分割模型 Cap2Seg即“利用文本描述生成提升 COVID-19 医学图像分割性能”。Cap2Seg不仅能够对病灶区域进行分割还能生成相关的医学文本描述并利用这些描述引导分割过程。得益于这种设计模型在推理阶段无需输入文本也能获得良好的分割性能。为了减轻不准确文本对模型性能的影响我们考虑了生成文本特征与视觉特征之间的一致性并提出尺度感知文本注意力模块Scale-aware Textual Attention ModuleSATaM。该模块能够降低模型对无关或误导性文本信息的依赖。随后我们设计了一种词—像素融合解码机制将文本特征有效地融入视觉特征确保文本信息能够对图像分割任务形成有效补充从而提升分割性能。在 MosMedData 和 QaTa-COV19 两个公开数据集上的大量实验表明在相同实验条件下本文方法优于当前最先进的模型。此外我们还通过消融实验验证了各个所提模块的有效性。代码地址https://github.com/AllenZzzzzzzz/Cap2Seg图一图1 当前医学图像分割模型。(A) 传统医学图像分割方法。(B) 视觉-语言多模态医学图像分割方法。(C) 本文提出的模型。三种医学图像分割范式传统医学图像分割医学图像 → 视觉编码器 → 视觉解码器 → 分割掩码输入只有CT等医学图像视觉编码器提取病灶特征视觉解码器恢复空间分辨率最终输出病灶区域的二值掩码。优点是结构简单不需要文本缺点是只利用图像信息图像模糊或病灶边界不明显时缺少额外语义信息辅助判断。普通视觉—语言多模态分割医学图像 → 视觉编码器 ┐ ├→ 多模态解码器 → 分割掩码 医疗文本 → 语言编码器 ┘输入包括医学图像与这张图像匹配的医疗文本描述。视觉编码器提取图像特征语言编码器提取文本特征多模态解码器融合两种特征后输出病灶掩码。问题在于推理时必须同时提供图像和对应文本。如果没有报告、文本与图像不匹配或者文本中存在错误分割性能可能下降。Cap2Seg┌→ 文本描述生成器 → 生成医学描述 医学图像 → 多模态编码器 └→ 多模态解码器 → 分割掩码 ↑ 生成文本Cap2Seg推理时只输入医学图像不需要外部提供文本。模型内部完成两个任务根据图像生成医学文本描述利用图像特征和生成的文本特征共同完成病灶分割。图中橙色向上的箭头表示文本生成器产生的语言信息被送入多模态解码器用来辅助图像分割。因此Cap2Seg最终输出两个结果病灶分割掩码模型生成的医学文本描述。训练阶段Cap2Seg仍然需要真实文本标注来监督文本生成器但模型训练完成后推理阶段只需要输入图像。图二图2 所提方法的整体框架。(A) 主导网络包含以下组件(B) 多模态协同DualFlow编码器MSDFE模块(C) 多模态语义增强与文本描述生成模块MSECM以及尺度感知文本注意力模块SATaM(D) 视觉解码器LAVD。图像编码 ↓ 生成医学描述 ↓ 用不同尺度的图像证据筛选文本信息 ↓ 融合图像与文本特征 ↓ 输出病灶掩码ACap2Seg整体流程输入图像首先经过4个连续的 MSDFE 编码模块输入图像 ↓ MSDFE1 → MSDFE2 → MSDFE3 → MSDFE4随着编码逐渐深入图像尺寸不断减小特征通道增加浅层主要提取边缘、纹理等细节深层主要提取病灶位置、范围和整体语义。最深层特征被送入 MSECM深层图像特征 ├→ 强化分割所需的视觉特征 └→ 生成医学文本描述生成的文本经过词嵌入后通过图中的橙色路线传递给不同尺度的 SATaM。SATaM利用各层图像特征判断文本中哪些词可信然后将处理后的语言特征传入对应尺度的 LAVD。最终4个 LAVD逐级上采样输出病灶分割掩码。因此整个模型有两个输出Output_seg病灶分割掩码Output_cap生成的医学文本描述。BMSDFE双流编码器多模态协同双流编码器它内部有两条分支Transformer分支TransBlockLayerNorm ↓ 多头自注意力 MSA ↓ 残差连接 ↓ LayerNorm ↓ MLP ↓ 残差连接它主要负责提取全局病灶结构长距离区域关系左右肺之间的整体信息。CNN分支ResBlock使用3×3卷积Batch NormalizationReLU残差连接。它主要负责提取病灶边缘局部纹理小范围细节。两个分支融合后模型同时拥有局部和全局视觉信息。论文使用4级 MSDFE。前两级两个分支相对独立后两级开始相互融合。MSECM语义增强与描述生成它把深层特征分成两个方向VSE视觉语义增强VSE使用膨胀率分别为1、3、6、9的卷积不同膨胀率对应不同感受野用于提取不同大小的病灶小感受野关注局部边界大感受野关注整体感染范围。这些特征最终用于分割。TSE文本语义增强TSE先用 Transformer 整理视觉语义再将其送入 LSTM逐词生成医学描述深层图像特征 ↓ Transformer ↓ LSTM ↓ “Bilateral pulmonary infection...”生成的句子随后转换成词嵌入供 SATaM 和 LAVD 使用。SATaM尺度感知文本注意力SATaM位于每一级编码器和解码器之间。同一句文本在不同图像尺度上的作用不同例如浅层图像特征适合判断边缘和局部细节深层图像特征适合判断左右肺、病灶数量和整体位置。SATaM用当前尺度的图像特征给文本中的词分配权重“bilateral” → 图像确实显示双侧感染 → 高权重 “two areas” → 图像支持两个区域 → 高权重 “upper left” → 图像证据不明显 → 低权重因此它试图降低无关或错误生成词对分割结果的影响。橙色箭头表示语言特征流生成文本被送到不同尺度的 SATaM 和 LAVD。CLAVD语言感知视觉解码器它接收三类输入上一级解码器输出的视觉特征当前尺度的编码器跳跃连接特征SATaM处理后的语言特征。其注意力计算可以简单理解为视觉特征作为 Query 语言特征作为 Key 和 Value模型针对每个图像位置寻找最相关的词。例如肺部某一区域可能主要关注left lungupperinfected area得到语言增强的视觉特征后再与编码器的跳跃连接特征拼接经过残差卷积和上采样逐步恢复到原始图像尺寸。Cap2Seg首先用 CNN和Transformer联合分析图像根据深层图像特征生成医学描述随后利用不同尺度的图像证据筛选文本中的有效信息并将这些语言信息注入分割解码器最终同时输出病灶掩码和医学描述。图三图 3具有尺度感知功能的文本注意力模块架构SATaM 尺度感知文本注意力模块根据图像内容给文本中的每个词分配权重增强与病灶相关的词削弱无关或可能误导的词。模块的两个输入图像特征表示第 (i) 层编码器输出的视觉特征浅层特征分辨率较高主要保留边缘和局部纹理深层特征分辨率较低主要表达病灶位置和整体语义。文本特征表示模型生成文本的词特征。图像—词语相关性计算视觉特征和文本特征分别经过线性层投影到相同的特征空间然后进行矩阵乘法它表示每个图像位置与每个文本词之间的相关性计算每个词的注意力权重模型把一个词在所有图像位置上的响应汇总得到这就是图中间的彩色竖条每个格子代表一个词的权重颜色越深表示该词与当前尺度的图像特征越相关。因此如果模型生成了一个与图像不太匹配的词理论上该词会得到较低权重。生成尺度感知句子特征词权重与原始文本特征再做加权求和它是整句话在当前图像尺度下的综合语义表示所以叫“尺度感知”同一句文本在不同层级会产生不同的注意力权重将句子特征加入原始词序列尺度感知句子特征经过一个1x1卷积然后与原始文本特征 (L) 拼接。原来有 (T) 个词特征加入一个句子级特征后变成可以将其理解为在文本序列前加入一个特殊的视觉语义 token[当前尺度的整体句子特征] bilateral pulmonary infection two areas ...Self-Attention 更新文本特征拼接后的特征进入 Self-Attention。Self-Attention让每个词与尺度感知句子特征交互Self-Attention输出再与原始文本特征通过残差连接相加。图中的圆圈“”就是逐元素相加。最后经过1x1卷积得到这就是经过当前尺度图像信息增强后的语言特征会被送入 LAVD 分割解码器当前尺度图像特征 ─→ 线性映射 ─┐ ├→ 图像—词语相关性 原始文本特征 ─────→ 线性映射 ─┘ ↓ 每个词的注意力权重 ↓ 加权得到句子特征 ↓ 与原始词特征拼接并自注意力融合 ↓ 当前尺度的视觉增强文本特征表一表1比较了基于mosmeddata数据集的当前最先进的分割方法。灰色阴影标注的方法排除文本输入而其他方法则包含文本输入。三组实验条件w/o Text不输入文本CT图像 → 分割模型 → 病灶掩码U-Net、UNet、TransUNet等灰色阴影方法本身是纯视觉模型不支持文本输入所以只有这一栏有结果其他栏用“–”表示不适用。非灰色的多模态模型也在无文本条件下进行了测试用于观察缺少文本时的性能。Generated Text输入生成文本这里使用的不是医生提供的真实标注而是 Cap2Seg根据图像生成的医学描述。对于 ConTEXTualNet、LAVT、TGANet和LViT-T作者将这种生成文本作为其语言输入然后观察分割性能。这项实验主要回答当只有自动生成的、可能存在误差的文本时多模态分割模型表现如何Ground Truth Text输入真实文本这里输入的是数据集中人工标注的正确医学描述。理论上这是文本质量最高的条件医学图像真实文本 → 多模态模型 → 分割掩码它可以反映文本完全正确时多模态模型能够达到的性能上限。表格反映的结果与纯视觉模型比较纯视觉方法中表现最好的是 COPLE-NetmIoU60.93%Dice74.08%Cap2SegmIoU63.02%Dice75.87%因此Cap2Seg相对最佳纯视觉模型提升mIoU2.09个百分点Dice1.79个百分点。这说明生成文本辅助可能提供了额外的病灶语义信息。生成文本条件其他模型使用 Cap2Seg生成的文本时模型DiceConTEXTualNet70.08%LAVT69.86%TGANet71.81%LViT-T73.41%Cap2Seg75.87%Cap2Seg表现最好。真实文本条件使用真实文本时表现最好的是 LViT-TmIoU61.33%Dice74.57%Cap2Seg不使用外部真实文本但仍获得mIoU63.02%Dice75.87%也就是说在这个数据集上Cap2Seg仅依靠图像和内部生成文本就超过了部分使用真实文本的多模态方法。它主要说明Cap2Seg推理时不需要外部医疗报告内部生成文本可以辅助分割普通多模态模型在生成文本条件下可能性能下降Cap2Seg对其自身生成文本具有一定适应能力。表二表2比较了QaTa-COV19数据集上最先进的分割方法。灰色阴影标注的方法均排除文本输入而其他方法则包含文本输入。图四图4 所提方法与不同分割方法的可视化对比表三表3基于mosmed数据集的消融研究。“基线”表示使用CNN作为编码器“基线*”表示采用本文提出的 MSDFE 作为编码器“SATaM∕SCloss”表示从SATaM模型中移除了SCloss损失函数。对比mIoU提升Dice提升说明Baseline → Baseline*1.721.35MSDFE有效Baseline* → MSECM0.740.68语义增强和文本生成有效Baseline* → SATaM0.600.41文本注意力有效去掉SCloss → 完整模型0.790.95跨尺度一致性约束有效Baseline → 完整模型3.783.04所有模块综合有效图五图5 不同组件效能的视觉对比表四表4 编码阶段不同 MSDFE 模块中两个子模块间相互作用的影响。‘✓’表示当前 MSDFE 模块内的相互作用。MSDFE内部的 CNN分支ResBlock和 Transformer分支TransBlock应该从第几层开始融合图像 ↓ MSDFE1 → MSDFE2 → MSDFE3 → MSDFE4 浅层 深层融合方式mIoUDiceMSDFE1–4全部融合61.8974.78从MSDFE2开始融合61.4374.54从MSDFE3开始融合63.0275.87只在MSDFE4融合61.0274.06