Back to Feed
总结
DeepSeek于元旦发布一篇新论文,提出名为mHC(流形约束超连接)的新架构,目标是在大规模模型训练场景中缓解传统超连接带来的训练不稳定问题,同时尽量保持其显著的性能增益。论文披露共有三位第一作者:Zhenda Xie(解振达)、Yixuan Wei(韦毅轩)、Huanqi Cao,DeepSeek创始人兼CEO梁文锋亦出现在作者名单中。该论文被视为公司在模型架构与训练稳定性方向的最新研究进展。
正文
【DeepSeek发布梁文锋署名新论文 开启架构新篇章】 DeepSeek在元旦发布了一篇新论文,提出了一种名为 mHC (流形约束超连接)的新架构。该研究旨在解决传统超连接在大规模模型训练中的不稳定性问题,同时保持其显著的性能增益 。这篇论文的第一作者有三位:Zhenda Xie(解振达)、Yixuan Wei(韦毅轩)、Huanqi Cao。值得注意的是,DeepSeek创始人&CEO梁文锋也在作者名单中。
发布时间: