字节在大模型赛道上的滞后焦虑
字节跳动在大模型赛道上的处境,用“起大早赶晚集”来形容并不为过。
早在2023年初,字节就组建了专门的大模型团队,但直到去年底才推出首个正式版本。相比同期起步的百度、阿里,甚至晚于月之暗面等创业公司,字节的节奏明显偏慢。
这种滞后在内部引发了持续焦虑。据晚点LatePost报道,今年上半年,字节多个Seed团队已开始不断反思,而近期讨论训练超5万亿参数模型,正是这种反思后的直接产物。
5万亿参数计划的执行框架
这项计划目前仍处于早期讨论阶段。
消息称,该模型将由Seed Foundation负责人项亮主导,与大语言模型预训练数据负责人沈科合作。项亮2016年加入字节,曾负责机器学习中台团队;沈科2018年清华毕业后加入字节,现主要负责预训练数据工作,二人均出自字节的“搜广推”体系,是AI研发核心骨干。
从规模上看,5万亿参数远超目前国内已知的最大模型——阿里的Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数),差距接近一倍。
一位字节内部人士直言,这种将参数规模一次推到同行数倍的做法,“像一场赌博”。
张一鸣的态度与判断

两周前的Seed全员会上,张一鸣罕见地露面并安抚团队。
他告诉团队成员,训练大模型本就是一件很难的事,不必过度焦虑。他明确表示,可以接受模型在一段时间内落后于行业,但目标必须是追求智能上限,最终跻身世界第一梯队。
值得注意的是,张一鸣在这番表态中明确反对“蒸馏”技术。在他看来,蒸馏虽然在短期内能改善模型表现,但本质上只是在复制Claude等已有模型的能力,沿着这条路走,最多只能不断逼近对方,很难真正实现超越。
这也解释了字节为何选择“一步到位”的大参数路线——放弃短期追赶的策略,直接用规模换取底层能力的跃升。
对国内AI格局的潜在冲击
如果这一计划最终落地,将对国内AI竞争格局产生多重影响。
首先是算力层面的压力。 5万亿参数意味着训练成本将是现有模型的数倍,对算力集群、电力供应和工程能力都是极大考验。字节是否有足够的资源支撑这一计划,仍是未知数。
其次是策略层面的转向。 国内大模型行业此前一度形成“卷应用、轻底座”的共识,字节此举可能重新将竞争焦点拉回模型本身的智能水平上。
最后是人才层面的争夺。 如此大规模的模型训练,需要顶尖的算法和工程人才。字节能否在现有团队基础上完成这一目标,将直接影响计划的成败。
对普通用户意味着什么
但如果字节成功,意味着未来豆包等产品的智能水平可能实现一次质的跃升——从“够用”变成“好用”,在处理复杂任务时的表现会更接近国际顶尖水平。
不过训练这样规模的模型需要时间,从讨论到落地至少需要一年以上。在此之前,字节的产品体验可能仍会落后于第一梯队。张一鸣所说的“可接受短期落后”,对用户来说也是同样的预期。