
“计算需求在指数级攀升,今天,仅依靠产能的线性增长去堆叠算力,已经远远无法弥合供需之间持续扩大的缺口。”
7月20日,2026 年世界人工智能大会上,无问芯穹联合创始人兼CEO夏立雪提出,从预训练(Pre-training)到后训练(Post-training)、从推理时扩展(Test-time)到智能体扩展(Agentic scaling),在四条规则定律(Scaling Law)的作用下,模型训练和推理的超级市场正在互相孕育。

当下的人工智能基础设施(AI Infra)“必须以极致的效率服务更大规模。”
基于规模与效率两大锚点,夏立雪从无问芯穹的AI生产力公式(AI生产力=智能资源规模× Token转化效率×AI生产力转化效率)出发,首次公布无问芯穹Agentic Infra的“前店后厂一中心”战略布局,涵盖三大核心技术能力与产品服务体系——“算力集散中心”,Agentic Infra自主式基础设施平台;“Token工厂”,Agentic MaaS大模型服务平台,“AI生产力商店”,Agentic Infra行业解决方案。
这套Agentic Infra产品与服务体系立足基础设施,向下汇聚能源和芯片,向上支撑模型和应用,不仅极致提升了底层资源向AI生产力转化的规模和效率,更有着Agentic AI时代最显著的AI原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效Token生产,并支持Agentic AI的持续进化。

服务下一代Agentic AI在线进化
无问芯穹Agentic Infra自主式基础设施平台的核心目标,是实现智能资源规模最大化。它就像一座“算力集散中心”,把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。
夏立雪认为:“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”

无问芯穹自成立以来一直致力于通过“多元异构、软硬协同”技术破解异质算力聚合的难题,打造了面向异构集群的大模型跨域训练系统,并集成于Agentic Infra自主式基础设施平台软件中,通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制,三位一体全栈协同优化,能够系统性地破解算力聚合的行业难题。
该系统已经受过三大类跨域算力聚合训练实践的生产级考验——
第一是超远距离聚合。无问芯穹已联合中国电信,完成了国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%,验证了超远距离跨域集群协同训练的可行性。
第二是多数据中心聚合。打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,有效盘活了不同批次的存量异构算力。
第三是混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升68%,帮助众多企业客户解决本地算力不足、云上资源却闲置的错配痛点。

新民晚报记者获悉,目前这套跨域训练系统已在全国部署触达超37000P算力、覆盖16种主流芯片,盘活了广域分散的异质算力,使之成为Agentic AI时代的最坚实底座。
夏立雪表示,伴随着大规模跨集群强化学习训练技术的持续成熟突破,无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术,“未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。”

Token工厂以“效”搏大
Token经济时代,无问芯穹在2023年初就提前布局的Agentic MaaS大模型服务平台,目前正在迎来高速且持续的增长曲线。该平台就像一座“Token 工厂”,核心目标是用极致效率服务Token的规模化、高质量生产。
发布会现场,夏立雪用千卡至万卡规模下完整推理服务技术栈揭示了一座Token工厂内部的可优化空间,“从网关、路由,到底层推理实例,Token工厂层层可优化、处处有增量。”

随后,夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)。
智能体推理需求的特征有“三极”:上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。同时,从实测数据中能直观看到,不同芯片在Prefill、Decode阶段的性能差异极大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且几乎每个集群都“偏科”。
因此,该架构首先用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来,让算力强的集群做Prefill任务,让显存带宽高的集群做Decode任务。这一架构设计相当于让“偏科”的硬件只刷自己最擅长的题,可以极大提升大模型推理系统效率,是每座Token工厂都必备的“超级管线”。
新民晚报记者注意到,PDD将传统的 PD分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构,就像是为这条“超级管线”加装了一个“精密增压阀”。对于高传输延迟的请求,RelayDecode先行输出 Token 给用户,从而让用户侧完全感受不到这一实际上长达数十秒的传输延迟;当传输完成后,输Token给用户的任务被无缝切换给MainDecode来处理,避免了RelayDecode被长期占用。通过这一设计,仅需极少量机器承担RelayDecode ,就能掩盖以太网KV Cache传输延迟。
实测显示,该架构在实现首Token延迟(TTFT)降低51.5%的同时,单Token成本可降低37.5%。这不仅意味着用户端速度体验的显著提升,更意味着,每一个集群都能被充分利用起来,最大化释放全域异构算力的产业应用价值。

过去一年里,无问芯穹的Token工厂已通过一系列原始技术创新,推动了推理成本的 10 倍下降。夏立雪判断,随着跨集群异构PD分离架构的规模化落地,推理成本依然有10倍的下降空间。
据悉,无问芯穹已携手上海移动联合打造了“沪芯沪产服务沪客”的“天问”模型服务门户,也与AI原生新世代社区“观猹”联合打造了“中国版OpenRouter” TokenDance(词元跳动)平台。未来,无问芯穹将持续携手优秀的行业伙伴,以这套高效的“Token 工厂”赋能更多产业领域、服务更广泛用户。
创元网配资提示:文章来自网络,不代表本站观点。