中文会议纪要
国泰海通计算机TVK3解密2.8万亿参数之后,国产大模型下一程
公开摘要
本次会议围绕月之暗面Kimi K3模型发布展开,该模型参数达2.8万亿,采用MoE架构,激活16个专家,上下文窗口100万token,综合性能全球第三,部分细分赛道超越Claude 3.5和GPT-4。专家解读了K3的技术创新,包括深度残差注意力机制(KDA)、混合注意力(MLA)、混合精度训练(FP4/FP8)等,强调其在长程任务上的突破和系统级创新。成本
本页仅展示公开检索接口已提供的短摘要;完整纪要、问答和音频需登录并校验会员权益。
查看会议访问权限