技术拆解(五):残差连接到底在“残”什么?HC、MHC和注意力残差,一张图根治困惑
1.概念理解①原始残差X输出XFX原始残差输出等于输入加上对输入做的改变让模型只需要学习“差了哪一点”。②HCX输出Mapping[X]Mapping [F₁(X), F₂(X), ..., Fₙ(X)]ᵀ注Mapping矩阵[X]Mapping矩阵[将X变为n 条并行的分支变换每条都可以是不同的操作比如线性投影、激活、甚至子网络进行输出拼接]HC输出是把原始输入和原始输入经过多条不同路径改变后的结果全部拼在一起再整体用Mapping矩阵转换一次。注这里矩阵没限制。③mHCX输出Mapping[X]Mapping [F₁(X), F₂(X), ..., Fₙ(X)]ᵀ注只是这个Mapping矩阵限制为双随机矩阵就是行列加起来都为1来保持训练稳定。mHC和HC一样但最后转换时的权重被Mapping矩阵限制成每一行、每一列加起来都是1从而自动保持数值稳定。④注意力残差X输出ZFX注10层一块其中Z是前面所有块输出的加权和块内沿用原始的残差连接等权求和作为基础信息的稳定积累管道。块间每个块被压缩为一个表征向量后续块在计算Z时通过注意力机制加权求和 来决定如何聚合这些块级信息注意力残差输出等于前面所有块10层一块输出的加权总和加上当前层内部的改变量其中权重由注意力机制自动分配。2.总结比较3.图示图1(a)传统残差 与(b)HC 与c(mHC)图2注意力残差哲学视角“残差不是绕路而是捷径。”—— 四种设计将信息传递拆解为直连原始残差、多路复用HC、正则约束mHC与全局累积注意力残差让神经网络既能保留原始特征又能灵活融合多分支变换同时避免训练不稳定。这恰是对“学而时习之不亦说乎”的工程化复现原始残差保证了梯度直达与恒等映射HC通过并行分支的拼接拓宽了表示维度mHC用双随机矩阵维持能量守恒与训练平稳注意力残差则让历史层输出加权贡献——每一次前向传播都站在过往激活的阶梯上望向更深的地方。