国产算力规模化落地,大模型推理成本迎来拐点
近日,一则关于AI推理成本大幅下降的消息引发了行业关注。智谱公司披露,其通过部署规模达十万级的国产芯片集群,成功将大模型推理的单位Token成本压降至年初水平的仅20%,降幅高达80%。这不仅是一个成本数字的变化,更意味着国产AI算力在支撑大规模商业应用方面迈出了实质性的一步。
十万芯片构筑算力基石,成本与性能双突破
实现这一成本突破的核心,在于超大规模国产芯片的集群化部署与优化。智谱构建的这个由超过十万张国产芯片组成的算力池,并非简单的硬件堆砌。在此之前,该算力集群已经历了真实线上流量的严格压力测试,证明了其稳定性和可靠性。
更值得关注的是其成本效益。单位Token推理成本80%的降幅,直接降低了AI模型调用的门槛,使得更多企业和开发者能够以更经济的成本接入和利用大模型能力,为AI应用的普及铺平了道路。
从匿名测试到全面承载,验证国产算力“真功夫”
这批国产算力的实战能力在其最新模型GLM-5.3-Flash的发布过程中得到了充分验证。一个有趣的细节是,在该模型正式发布前,其早期版本曾以“Ox-Alpha”的匿名身份在OpenRouter和OpenCode等平台上线。期间,其累计处理的Token调用量达到了惊人的62万亿规模,这相当于进行了超大规模的真实世界预演。
而模型正式发布后,所有的线上服务流量也完全由这十万张国产芯片承接。这无疑是一次成功的“压力测试”,证明了国产算力集群有能力从测试环境平滑过渡,并稳定支撑起一款主流大模型产品的全部公开服务需求。
行业影响:自主算力生态加速成熟
此次国产芯片在大模型推理场景的成功规模化应用,释放出多重信号:
- 技术可行性得到验证:国产AI芯片在软硬件协同、集群效率、稳定性等关键指标上已能满足复杂AI任务的要求。
- 经济模型更具竞争力:大幅降低的推理成本使得基于国产算力构建的AI服务在市场上可能具备更强的价格优势。
- 供应链安全性提升:规模化应用降低了对于单一技术来源的依赖,为国内AI产业的长期发展提供了更稳固的算力底座。
随着AI模型参数规模和用户需求的持续增长,推理成本一直是制约其商业化深度的重要因素。智谱的这次实践表明,通过规模化、集约化地利用自主可控的算力资源,有效控制并大幅降低核心成本是可能的。这或许会激励更多AI公司加大在国产算力路线上的投入与探索,进一步推动整个自主AI生态的繁荣。