Hyper-Connections 与 mHC:残差主干在 2024-2026 年的新进展

From LLM Guide

本文内容为中文原文;Article content is the original Chinese source, and this page does not provide a translation.

Hyper-Connections 与 mHC:残差主干在 2024-2026 年的新进展

标准残差连接长期像深层网络中的“默认公理”. 几乎所有研究者都承认:如果你想把网络安全地做深,就需要一条足够稳定的主干,让梯度和前向信息都有路可走. 过去十年里,这条主干最常见的形式几乎没有变过:输入表示沿一条残差路径继续往下传,子层只负责在旁路上写入一个修正项,最后两者相加.

这套设计之所以长期不动,不是因为它最聪明,而是因为它太可靠了. 它不是让每一层都一开始就学得很好,而是允许很多层先学会“不破坏已有表示”,再逐步学会“贡献真正有价值的新变化”. 在数十层乃至上百层网络里,这种保底机制几乎比任何局部子层的巧妙设计都更重要.

但一个结构只要长期太稳定,就很容易被当成“无需再讨论的基础设施”. 于是很多架构创新都集中在子层里:改注意力、改前馈、改位置编码、改归一化、改路由、改量化. 残差主干本身很少被视作真正的创新对象. 直到模型深度、规模、任务复杂性持续增长,研究者才开始再次意识到:也许标准残差连接不仅仅是“稳定”,它也可能是“过于单一”.

2024 到 2026 年,围绕这个问题形成了一条新的演化线索. 字节系团队提出 Hyper-Connections(HC),尝试让残差主干从单流变成多流; DeepSeek 团队进一步提出 mHC(Manifold-Constrained Hyper-Connections),试图在保留多流收益的同时,重新把 identity mapping 的稳定性找回来. 两者连起来看,讨论的已经不是“残差连不连”这么简单,而是:**残差主干本身是否也应该被重新设计. **

如果说标准残差连接回答的是「怎样让网络安全地变深」,那么 HC 与 mHC 继续追问的是:**怎样让残差主干本身也拥有更强的组织能力,而不只是充当一条被动加法通道. **

本文围绕八个问题展开:标准残差连接真正强在哪里; 它在超深模型里暴露出哪些边界; Hyper-Connections 到底改了什么; 它为什么会提升表达能力; 它为什么又会引入训练不稳定; mHC 为什么必须出现; mHC 想保住的到底是什么; 以及为什么 HC / mHC 应该归入残差连接专题,而不应该被误归入注意力机制专题.

1. 标准残差连接真正强在哪里

标准残差连接最常见的形式是:

hl+1=hl+Fl(hl)(1)h_{l+1}=h_l+F_l(h_l) \tag{1}

这里 hlh_l 是第 ll 层输入表示,Fl(⋅)F_l(\cdot) 是当前层学到的增量修正,hl+1h_{l+1} 是该层输出. 这个公式真正强的地方,不是它简单地“多加了一项输入”,而是它把深层网络的默认行为改写成了一个更加温和的过程:**先保留已有表示,再叠加新的修正. **

这件事听起来朴素,但它带来了深层训练最宝贵的三个性质. 第一,如果某个子层暂时学不好,网络仍然能退回接近恒等映射的状态,而不会立刻把主干整体毁掉. 第二,梯度回传时始终存在一条不完全依赖局部子层质量的安全路径. 第三,前向信息不会因为每一层都想“重新发明一遍表示”而轻易丢失.

换句话说,标准残差连接最关键的地方,从来不是它让网络“更炫”,而是它让网络在极端条件下也不那么容易失控. 它是深层系统里的保险丝、缓冲层和默认保底协议. 它的哲学不是「每层都必须很强」,而是「即使某层暂时不强,也别破坏整个主干」.

也正因为如此,标准残差连接最成功的地方,恰恰来自它的“过度简单”. 它几乎不给主干增加额外自由度,却换来了大规模训练中最值钱的稳定性.

2. 为什么这种简单在超深模型里开始显得不够用

标准残差连接非常稳,可稳并不总是等于最优. 这句话不是 HC / mHC 论文里的逐字原文,而是对它们共同问题意识的概括. 两篇工作的真正出发点都在指向同一个现象:**标准残差虽然长期稳定,但它也可能在约束超深模型主干的表达空间. **

这种约束首先体现在:所有层的信息最终都被压进同一条残差流. 浅层、中层、高层虽然承载着性质不同的表示,可最终都必须接受同样的累积规则. 这在网络还不够深时问题不大,因为主干里信息的堆叠复杂度还不算极端. 但一旦模型进入百层级,浅层的局部模式、中层的结构组合、高层的抽象行为全都被迫共享同一套流动协议时,主干开始显得稳定但狭窄.

第二个约束是:标准残差让主干几乎完全固定,而把表达自由度几乎都压给了子层. Attention 可以越来越复杂,FFN 可以越来越强,Norm 可以前置后置,位置编码可以继续迭代,但主干本身始终只做一件事:把旧表示和新修正直接相加. 这让模型被允许把“局部计算单元”做得越来越精巧,却很少被允许去重新设计“深度维上的主干组织方式”.

第三个约束是:标准残差默认在做“同权累积”. 所有层输出都按单位权重叠加回主干,意味着不存在显式深度选择、也不存在不同层贡献强度的结构差异. 可现实里的深度信息未必都该被一视同仁. 某些层可能更像短期修正,某些层可能更应该被长期保留,某些层可能更适合作为桥接通道,而另一些层则应该被更快衰减. 标准残差对此几乎没有表达能力.

HC 路线正是从这里起步的:**如果深度本身已经成为模型能力的重要来源,那么深度维上的主干连接方式就不该继续被当作固定常量. **

3. Hyper-Connections 到底改了什么

Hyper-Connections 的摘要已经非常明确. 它要做的是:扩展 residual stream width,多样化 connectivity patterns,调节不同深度特征间的连接强度,并允许层间连接发生动态重排. 把这些词翻译成人话,HC 干的事就是:**把原来只有一条流的残差主干,扩成多条并行流,并让这些流之间的组织方式也成为可学习对象. **

如果标准残差主干像单车道高速路,那 HC 更像多车道高速路. 不同层不再只是把修正项往一条主干里倒,而是可以决定:哪些流主要保留已有表示,哪些流吸收新的层输出,哪些流之间需要交换信息,哪些流承担“长期记忆通道”的角色,哪些流承担“短期修正通道”的角色.

从抽象上,可以把它理解成:

Hl+1=Ml(Hl)+Gl(Hl)(2)\mathbf{H}_{l+1}=\mathbf{M}_l(\mathbf{H}_l)+\mathbf{G}_l(\mathbf{H}_l) \tag{2}

这里 Hl\mathbf{H}_l 不再是单个残差向量,而是一组并行残差流; Ml\mathbf{M}_l 表示跨流混合或重排; Gl\mathbf{G}_l 表示当前层在这些流上写入的新修正. 这个公式并不是为了逐字复刻论文细节,而是为了准确表达 HC 的结构本质:**主干不再只是背景,主干本身也开始拥有建模职责. **

这和标准残差的哲学是一次明显转向. 标准残差在问的是「怎样让主干尽量简单、尽量稳」; HC 则开始问「如果主干本身更有组织能力,是不是可以继续提升深层模型的表达上限」.

4. HC 为什么会带来更强的表达能力

HC 能带来收益,最直观的原因就在于它放宽了深度维上的信息组织限制. 在标准残差里,所有层的修正最后都挤进同一条流里; 在 HC 里,不同流可以承担不同角色. 你可以让某些流偏保浅层特征,某些流偏承结构组合,某些流偏吸收高层语义修正,某些流更像稳定底座,某些流更像高频更新通道. 于是深度维上的信息流不再只是一锅混合物,而开始具备角色分工.

第二个收益来自层间关系本身的丰富化. 标准残差里的层间关系几乎是单一模板:拿到上一层主干,算出修正,加回去,再继续传. HC 则允许更复杂的关系:信息可以沿某条流长期保留,可以在特定深度跨流转移,可以在某些层发生更强混合,也可以在另一些层保持相对独立. 这使得“层与层之间怎样连”这件事,不再是固定的,而是可学习的.

第三个收益,是它让主干组织开始拥有类似“多头化”的空间. 从哲学上说,HC 和多头注意力很像. 多头注意力的出发点不是说单头完全错了,而是说:不同关系模式不该都被压进同一个表示子空间. HC 的出发点也不是说标准残差错了,而是在说:不同深度信息未必都该被压进同一条残差流. 它本质上是在做主干层面的“多子空间化”.

所以 HC 的价值,不只是“多了几条流”,而是第一次认真把“深度主干本身也能携带结构自由度”这件事摆到了台面上.

5. 为什么更强表达会立刻带来训练不稳定

HC 最有意思的地方,不在于“它有收益”,而在于它几乎立刻撞上了深层网络最古老的那个壁垒:更强表达,通常也意味着更难稳. 标准残差最宝贵的地方不是表达最强,而是它有非常清晰的 identity mapping 退路. 只要子层学不好,修正项就可以靠近零,整层就退回一个近似恒等主干. 这给深层训练提供了极强的安全垫.

可一旦主干变成多流、多重排、多混合,你就不再只是简单地做“旧表示 + 小修正”,而是在做更复杂的主干重组. 于是“什么都不做就能退回安全主干”这件事不再像标准残差那样自然成立. mHC 论文摘要正是抓住了这一点:HC 虽然带来了 substantial performance gains,但这种 diversification fundamentally compromises the identity mapping property intrinsic to residual connections,并进一步导致 severe training instability、restricted scalability 和 notable memory access overhead.

这意味着 HC 面对的不是“没效果”的问题,而是一个更难处理的问题:**方向可能是对的,但代价太高. ** 对大模型来说,这种问题比“没提升”更棘手. 因为没提升的结构会被很快淘汰,而“有提升但不够稳”的结构通常说明你已经摸到了一个真有价值的设计空间,只是还没找到足够成熟的落点.

6. 为什么 identity mapping 这么难替代

要理解 mHC 为什么必须出现,得先理解一件事:标准残差连接最难替代的部分,不是它的表面形式,而是它背后的保底协议. 只要主干里存在一条足够接近恒等映射的路径,梯度就不至于完全依赖局部子层质量. 这意味着即便某些局部层短期表现很差,全局训练仍然能继续推进.

残差主干也不要求每一层都完整保留输入,而是保证:**如果某层没学到有价值的新变换,它至少别把旧信息全冲掉. ** 这使深层表示更像一条连续语义河流,而不是一串彼此断裂的局部加工站.

更重要的是,标准残差连接让新增层不需要“一开始就很聪明”. 它们可以先学会不破坏,再逐步学会创造真正有价值的修正. 深度可扩展性靠的从来不是“每层一上来就有大贡献”,而是“坏层不会立刻毁掉整网”. 任何替代结构如果不能保住这条底线,就很容易在规模扩张时原形毕露.

7. mHC:DeepSeek 为什么要给 HC 加回约束

mHC 并不是在否定 HC 的方向. 它承认两个判断都成立:残差主干确实存在进一步建模空间; 多流连接也确实可以带来表达收益. 但它同时指出:**如果这种多流连接不受控制,它会破坏标准残差连接最重要的稳定性来源. **

因此,mHC 的目标并不是“把 HC 再做复杂一点”,而是非常明确地回答一个问题:**怎样让多流残差仍然保有标准残差原本的 identity 退路. ** 这就是为什么它会把 HC 的连接空间投影到一个受约束的流形上. 这里的“流形”不用先理解成复杂几何对象,更实用的理解是:不是所有多流混合方式都被允许,只有那些仍然服从稳定结构边界的连接方式才被保留下来.

这也是 mHC 的真正意义:它不是对 HC 的边角修补,而是在给 HC 补它最缺的系统能力,也就是稳定性约束、可扩展性边界和主干保底机制.

8. mHC 的直觉:不是更复杂,而是“把复杂性关进笼子里”

如果从抽象上写,mHC 可以被理解成:

Hl+1=P(Ml)Hl+Gl(Hl)(3)\mathbf{H}_{l+1}=\mathcal{P}(\mathbf{M}_l)\mathbf{H}_l+\mathbf{G}_l(\mathbf{H}_l) \tag{3}

这里 Ml\mathbf{M}_l 是原本更自由的混合结构,P(⋅)\mathcal{P}(\cdot) 则表示把这种自由重新拉回一个可控空间. 这个公式的重点不是投影算子的形式,而是它所表达的结构态度:HC 的方向像是在说「让主干更自由」,mHC 的方向则是在说「让主干更自由,但这种自由必须被约束在不会破坏 identity mapping 的范围内」.

换句话说,mHC 不是简单地给 HC 增加一层修补逻辑,而是在重新回答“主干创新到底怎样才算可持续”这个问题. 它要解决的不是局部优化小毛病,而是整条多流残差路线是否还能继续往更深、更大推进.

9. mHC 想保住的到底是什么

mHC 真正想保住的,不是标准残差连接的全部外观,而是它最值钱的三件东西.

第一,主干必须仍然有一条安全通路. 无论多流结构多复杂,网络都不能失去“退回稳定状态”的可能性. 第二,网络必须仍能逼近恒等映射. 如果结构复杂到连“什么都不做”都很难表达,那它就已经偏离了残差哲学. 第三,扩深和扩模时不能迅速失稳. 大模型工程最怕的不是小模型少涨一点分,而是某条路线根本无法继续往更深、更大推进.

这三件事放在一起看,你就会明白:mHC 想保住的不是“残差连接的样子”,而是“残差连接作为深层主干保底协议的本质”.

10. mHC 的意义,不只是“更稳”

如果 HC 只是一个有效但不稳的结构,那它最多停留在论文讨论层. 而 mHC 的真正意义,在于它试图把这条路线重新变成 可持续扩展的工程对象. 对大模型架构创新来说,真正珍贵的不是某个结构在一张表里多涨几点,而是它有没有可能变成一条真正能继续扩深、扩模、被系统实现并兼容现有训练范式的路线.

因此,mHC 的价值不仅是“比 HC 稳”,而是它在试图回答:**主干结构创新怎样才能像注意力创新那样,真正走进下一代大模型主线. **

11. 这条路线和 Pre-Norm、DeepNorm、残差缩放是什么关系

HC / mHC 并不是孤立存在的. 它和过去几年围绕主干稳定性的很多工作,其实都在处理同一个大问题:**深层主干怎样既承载更多容量,又不把训练稳定性玩坏. **

与 Pre-Norm 的关系最直接. Pre-Norm 保护的是单流残差主干,它强调主干尽量保持纯净,让归一化和子层都退到旁路修正里. HC / mHC 进一步问的是:主干能不能不止一条流,多条流之间怎样保持类似稳定性. 所以它们不是冲突关系,而是“更复杂主干设计”与“更稳主干组织”的上下游关系.

与 DeepNorm / residual scaling 的关系,则更像“量纲控制”和“结构控制”的区别. DeepNorm、residual scaling 都在控制残差分支的幅值,让深层累积不至于失控; HC / mHC 则是在追问:如果连主干组织形态都复杂了,那除了控制幅值,是不是还要控制连接结构本身.

至于和 MoE 的关系,MoE 改的是参数调用路径,HC / mHC 改的是主干连接路径. 一个管“哪个子模块被激活”,一个管“激活结果怎样在深度主干里被组织”. 这意味着未来二者不但不冲突,甚至很可能在更大规模系统里相遇.

12. 工程上到底要付出什么代价

HC / mHC 的讨论,如果只停在“效果涨没涨”,其实是不够的. 因为它们改的是主干,主干每动一下,工程代价通常都比改局部子层更大.

第一是内存访问代价. 一旦残差流数量增加,流间混合就会带来更多读写. 标准残差的优势之一,就是 x + F(x) 几乎是最简单的主干融合方式; HC 一旦引入多流与重排,内存访问复杂度天然会上升.

第二是训练稳定性代价. 标准残差的“稳定”很大程度上来自结构僵硬. 你给它加自由度,就得付出新的稳定性代价. 这也是 mHC 为什么必须出现.

第三是内核与框架适配代价. 目前成熟框架都天然知道怎样高效做 residual add、norm、fused add + norm. 但如果主干变成多流混合,那就意味着现有 fused kernel 不一定直接能用,现有并行策略未必兼容,调度和 profiling 也要重做.

第四是规模外推代价. 很多结构在中小模型上看起来很有吸引力,可一进大模型训练,稳定性和带宽就会迅速把收益吃掉. 所以对 HC / mHC 这种主干路线来说,真正难的从来不是「提出一个聪明想法」,而是证明它在大规模系统里依然划算.

13. 为什么 HC / mHC 应该放在残差连接专题里

这个归类问题非常关键. HC / mHC 虽然很前沿,但它们的主问题依然是 残差主干如何组织. 它们真正回答的是:

  1. 残差流是否只该有一条;
  2. 多条残差流如何交互;
  3. 这种交互怎样不破坏 identity mapping.

因此它们最适合放在残差连接目录下,作为「残差连接新进展」专题,与标准残差、Pre-Norm、DeepNorm 构成一条演化链.

它们不应该被塞进残差基础篇,因为基础篇首先要把 x + F(x) 讲清楚; 但它们也不应该被归到注意力目录,因为它们真正改的不是 token 间交互,而是 深度主干的组织方式.

14. 为什么 Kimi Attention Residuals 不在这里

这条边界必须再强调一次. Kimi 的 Attention Residuals 虽然也在改 residual mixing,但它的核心机制已经不是“多流主干如何稳定”了,而是:**当前层如何通过注意力,从历史层表示里做选择性聚合. **

也就是说,Kimi Attention Residuals 的主问题已经变成了 深度维注意力聚合,所以更适合放进注意力机制变体目录. HC / mHC 与它最大的区别在于:

  • HC / mHC:主干设计问题;
  • Attention Residuals:注意力聚合问题.

二者都在挑战标准残差的默认答案,但挑战的维度不同.

15. 本节小结

如果说标准残差连接解决的是「如何让网络安全地变深」,那么 Hyper-Connections 问的是「残差主干能不能本身变得更有表达力」,而 mHC 则继续追问「这种更强表达怎样才能不破坏主干稳定性」.

所以,HC 与 mHC 的意义不只是“多了两个新模块名字”,而在于它们重新打开了一个长期几乎被冻结的设计空间:**残差主干本身,也仍然值得继续被设计. **

对大模型未来的架构演化而言,这可能是一条非常重要的信号. 过去十年,容量增长主要依赖更强子层; 未来一部分容量增长,也许会来自更聪明、更稳定、更有层次感的主干连接结构.

16. 参考文献

  1. Zhu, D., et al. (2024/2025). Hyper-Connections. arXiv:2409.19606.
  2. Xie, Z., et al. (2025/2026). mHC: Manifold-Constrained Hyper-Connections. arXiv:2512.24880.