Routine国内 · 科技DeepSeek发布mHC架构论文DeepSeekTransformer架构大模型架构+2新年第一天,DeepSeek发布新论文,提出名为mHC(流形约束超连接)的新架构,旨在解决传统超连接在大规模模型训练中因破坏恒等映射属性而引发的数值不稳定与信号爆炸,同时保持性能增益。论文将Transformer的单一残差流扩展为多流并行,并用Sinkhorn-Knopp算法把连接矩阵约束到双拟随机矩阵流形上以稳定训练。论文第一作者为解振达、韦毅轩、Huanqi Cao,创始人兼CEO梁文锋亦在作者名单中。-