今日头条
MiniMax管理层会议纪要:(完整版请联系我们)
内容摘要
1. 管理层预计Q3国内4个大模型达到3T参数量级(4Q达到6个),不同模型的推理效率或有1倍的差距;M3 Pro会是2.8T。当前国内算力稀缺,能够支撑溢价/毛利率。 2. 公司IPO资金投入自建算力后,7月有效训练时长占比达97%;预计10月整合后,海内外分别达到万卡级别的单集群能力。因为MoE优化+ 3Q25开始自建,推理成本为外部供应商的一半到1/3,基本是自主调度及运维集群。已自建30-40%的分布式存储(总量近千PB),网络/存储引发的训练中断显著下降。 3. M3核心看点(9-10月出大参数版本):Sparse Attention架构· 长文本中推理速度比线性Attention类模型快3-4倍,缓存率显著提升,是3T量级模型中性价比最高的产品。已经搭建了大规模强化学习基建,在各任务类别上均已跑通。…
内容已经过来源标识、推广链接、联系方式和异常字符清洗。
返回今日头条