<汇港通讯> 内地人工智能(AI)初创 DeepSeek(深度求索)在元旦日发布了一篇新论文,提出了一种名为 mHC(流形约束超连接)的新架构,旨在解决传统超连接在大规模模型训练中的不稳定性问题,同时保持其显著的性能增益。
简单来说,DeepSeek 提出的 mHC 通过将传统 Transformer 的单一残差流扩展为多流并行架构,并利用 Sinkhorn-Knopp 演算法将连接矩阵约束在双拟随机矩阵流形上,成功解决了超连接(HC)在大规模训练中因破坏恒等映射属性而导致的数值不稳定和讯号爆炸问题。
这篇论文的第一作者有三位,包括解振达、韦毅轩、Huanqi Cao。值得注意的是,DeepSeek 创始人梁文锋也在作者名单中。 (BC)
#DeepSeek #梁文锋 #AI
新闻来源 (不包括新闻图片): 汇港资讯