据科技行业内部消息透露,字节跳动正酝酿一项雄心勃勃的人工智能计划——开发参数规模突破5万亿的超大模型。这一数字不仅远超阿里巴巴近期发布的Qwen 3.8-Max(2.4万亿参数)和月之暗面公司推出的K3(2.8万亿参数),更将刷新国内大模型参数规模纪录。不过知情人士强调,该项目尚处于概念验证阶段,最终是否落地仍存在不确定性。
该项目的核心推动力量来自字节跳动人工智能研究院Seed Foundation。据内部人士披露,项目将由算法专家项亮领衔,与预训练数据负责人沈科组成技术攻坚小组。为保障项目推进,Seed部门正在进行组织架构调整,重新划分研发团队职责并优化资源配置。这种"双核心"架构设计,既保证了算法创新与数据工程的协同,也体现了字节跳动对超大模型训练的系统性布局。
两位技术负责人均具有深厚的"搜广推"(搜索、广告、推荐)技术背景。项亮作为中科院自动化所博士,2016年加入字节后先后主导机器学习中台和豆包大模型基础架构建设,在分布式训练系统设计方面经验丰富。沈科则是清华大学2018届毕业生,专注大规模预训练数据构建,其团队开发的数据清洗与增强技术曾显著提升模型训练效率。这种技术组合被业内视为"算法-数据"双轮驱动的典型配置。
关于选择超大规模参数的技术路线,接近项目组的人士分析称,当前大模型领域已进入"军备竞赛"阶段,单纯提升现有模型尺寸难以形成质变优势。字节跳动选择将参数规模直接提升至行业平均水平的两倍以上,旨在通过规模效应构建技术壁垒,在多模态理解、复杂推理等前沿领域争取先发优势。这种"跨越式发展"策略,与该公司过往在短视频推荐、广告算法等领域的技术突破路径一脉相承。
行业观察人士指出,训练5万亿参数模型面临多重挑战:不仅需要数万张高端GPU的算力支持,更涉及分布式训练框架优化、数据管道重构等系统工程难题。即便模型成功训练,如何实现高效推理部署、控制算力成本也是关键考验。字节跳动若能突破这些技术瓶颈,或将重新定义国内大模型的技术天花板,为AI应用生态带来新的想象空间。

















