全球人工智能企业发布大模型的速度显著提升,从过去一年一次的周期缩短至季度、月度甚至数周。
这一变化既源于技术自身的进步,也受到日益加剧的市场竞争驱动。分析人士指出,随着不同模型在能力上趋于一致,任何技术上的领先优势都难以持久。因此,中国和美国的人工智能企业都已陷入一场无法停止的“无限游戏”,每一次发布都并非终点,而是为了在持续的竞争中保持一席之地。
中国AI公司智谱于8月14日推出了GLM5.3,声称其编程能力已达到当前开源模型的顶峰。距离其上一版本GLM5.2的发布,仅仅过去了两个月。智谱公司成立于2019年,源自清华大学计算机系知识工程实验室。该公司在2024年1月16日发布了GLM-4,而一年半后的2025年7月才推出了GLM4.5。然而,今年以来,智谱已发布了三次更新,每次更新的间隔时间都在缩短。
这种加速趋势并非智谱独有。另一家中国AI企业月之暗面,在今年1月、4月、6月和7月相继推出了Kimi K2.5、K2.6、K2.7和K3,其中最短的间隔仅有一个月。
美国公司也在加快步伐。Anthropic在2024年大约每四个月更新一次模型,但到了2025年下半年,更新周期缩短至两个月。今年,Claude Opus 4.8和Opus 5之间仅相隔两个月,而在此期间,Anthropic还分别发布了Fable 5和Sonnet 5,新产品推出的间隔最快可达两周。
天使投资人郭涛在接受《联合早报》采访时表示,大模型迭代速度加快的一个重要原因是技术进步。“小版本更新无需重新训练全新的基础模型,而且‘后训练’技术的能力日益增强。”
“后训练”是指在现有基础模型之上,利用新的数据、用户反馈和强化学习来“补充学习”,从而提升模型能力。智谱官方也表示,其模型5.3和5.2的基础模型是相同的,新版本能力的提升全部来自于后训练。相比于重新训练下一代基础模型,这种更新方式成本较低,也更能快速响应竞争对手。
企业间的竞争无疑是推动这一趋势的关键因素。2025年1月,中国AI企业深度求索的DeepSeek-R1以较低成本实现了接近美国前沿模型的性能,这促使OpenAI首席执行官奥尔特曼公开表示,对新竞争者的出现感到兴奋,并计划提前部分发布计划。
南洋理工大学校长讲席教授、南洋商学院副院长丛林指出,AI大模型具备“能力可移植性”,这意味着领先者的能力,即使是闭源模型,也可能被其他模型通过“蒸馏”技术提取。
这也就意味着,一个模型取得短暂领先地位后,很快就可能被竞争对手的新版本赶超,迫使企业不断发布和迭代,以维持暂时的技术优势。
新加坡科技企业加速器云图SEGA的创始人丁新燕在受访时也形容,中美模型公司仿佛卷入了一场“无限游戏”,不存在一次性的胜负。
她指出,在AI产业链中,上游的芯片和云计算企业掌握算力,下游的平台和应用企业掌握用户入口,处于中间环节的模型公司容易受到两端的挤压,“商业模式本身非常脆弱”。
此外,不同模型的能力日益趋同,且尚未形成类似微信、脸书那样的社交关系网络,用户和开发者也更容易在不同模型工具之间切换。因此,厂商只能通过持续更新来维持竞争力。
丁新燕认为,“大模型更像是中美AI竞争的一个阶段性主战场,而不是终点”。
竞争将继续向上游和下游扩散:向下延伸至算力、芯片、光模块、数据中心和能源;向上则涉及企业应用、产业流程、机器人和实体世界。更进一步,它将影响制造业升级、技术标准和国际影响力,而大模型本身将逐渐演变为一种“基础能力”或“中间层”。
企业正在寻求摆脱单纯的模型竞争。
丁新燕认为,尽管中美模型公司表面上都在疯狂更新模型,但实际上它们都在拼命寻找出路,试图摆脱单纯的“纯模型竞争”。这种尝试更多是出于生存压力,因为算力成本高昂且毛利率低下。
目前,相当一部分大模型企业的更新,已经开始更加聚焦于细分领域的需求,推出不同价格档位和功能的产品。
例如,阿里巴巴在过去两个月发布的多个模型,分别针对图像生成(Qwen-Image 3.0)、机器人与具身智能(Qwen-Robot Suite)以及智能体训练与环境模拟(Qwen-AgentWorld)三个场景。Anthropic也更新了不同档位的模型,以覆盖高性能、主流应用和低成本等不同场景。
郭涛认为,中美大模型的发展不会仅仅朝着版本迭代持续加速的单一方向演进,“单纯比拼榜单跑分的阶段正在逐步落幕了”,未来市场将更加看重实际业务的落地成效。
“与此同时,模型将继续通过微调、蒸馏等方式向外输出新版本,对外发布将保持较高频率,但底层模型的重大技术飞跃仍然是低频事件。”