作品声明:个人观点、仅供参考

先说清楚这条消息的成色。

英国《金融时报》8月10日援引三位行业知情人士的说法:字节跳动正在推进一款超大规模模型的预训练,参数规模上限可达10万亿,综合体量对标 Anthropic 旗下顶级 Mythos 系列。路透社表示无法独立核实,字节跳动方面未公开置评。所以这是一条尚未被官方确认的市场消息,看的时候留个心眼。

数字得有尺子才有意义。

业内普遍估算,Anthropic 最先进的 Mythos 5 约8万亿参数,Fable 5 约5万亿——Anthropic 官方从不披露参数量,这些都是行业推测。国内目前推出的最大模型是月之暗面 Kimi K3,约2.8万亿。如果10万亿这个上限最终跑通,量级确实是 Kimi K3 的三倍以上。

但报道同时给了三个限定条件,值得完整抄一遍:第一,该模型目前仅处于预训练初期;第二,完整预训练周期预计3到6个月,流程走完才会进入微调;第三,能否正式对外发布、最终定型参数体量,都存在不确定性。

换句话说,这是"正在路上"的项目,不是已发布的产品。所有关于"中国最大模型"的推论,前提都建在一个还没跑完的训练任务上。

我更愿意讲另一层。

《金融时报》提到,字节的 Seed 团队约2000人,由前谷歌 DeepMind 研究员吴永辉带队。张一鸣在内部会上要求团队瞄准"世界领先的模型能力",并且明确不依赖蒸馏走捷径。蒸馏这条路短期见效很快——拿别人的模型输出去训自己的小模型,成本低、指标好看。代价是你的上限被别人的上限锁死了。

做内容这行也一样。抄爆款结构,三天就能起量;自己搭一套能反复用的方法,可能三个月还在亏。区别在于三年后你手里有没有属于自己的东西。

最后补一句技术常识:参数量只决定基础信息存储上限,实际推理、创作表现还受数据质量、训练框架、优化方案制约。参数更大但表现更差的模型历史上不是没有过。

点赞(0)

评论列表 共有 0 条评论

暂无评论
立即
投稿
发表
评论
返回
顶部