在2026世界人工智能大会(WAIC)的一场论坛上,云天励飞董事长兼CEO陈宁提出了一个引人注目的观点:GPU主导一切的时代已经结束,推理时代对算力的需求更加复杂,GPNPU有望成为新的黄金标准。这一论断引发了业界对AI芯片未来发展方向的深入思考。
陈宁指出,2012年至2025年可视为AI训练时代,模型和芯片的发展重点在于提升规模和性能。在此期间,NPU曾与小模型相辅相成,而具备超大规模并行计算能力的GPGPU则在大模型兴起后成为主流。然而,推理时代与训练时代截然不同,它需要应对大量不同模型、应用和服务等级,核心需求在于能否覆盖多场景并实现高吞吐和低成本。
面对如此复杂的需求,是否存在通用解决方案?陈宁给出的答案是GPNPU。这种新型芯片融合了NPU、GPGPU以及近存计算和算力积木技术,在保持高性能和灵活性的同时,提高了效率、降低了时延,并为大规模互联和算力扩展奠定了基础。他进一步表示,在推理时代,AI算力的竞争将从单颗芯片性能转向Token生成效率,要打造极致的Token性价比,不仅需要新的推理芯片,还需要重构AI基础设施。
在今年的WAIC上,云天励飞正式公布了面向AI推理芯片与集群的技术路线图,并透露计划未来推出三款云端大算力推理芯片:DeepVerse100P、DeepVerse100D和DeepVerse100L。这三款芯片将针对不同推理环节进行专用优化,共同提升系统效率。根据规划,云天励飞还将探索面向万卡异构集群的分离式推理芯片与集群方案,并持续完善IFWA软件栈。
作为国内最早探索AI推理芯片的企业之一,云天励飞自2014年成立以来一直聚焦于AI推理领域。2023年,公司登陆科创板,成为“AI推理芯片第一股”。陈宁介绍称,公司早在2024年就开始布局第五代GPNPU架构,以GPNPU为核心架构,以Token性价比为最终评价尺度,推动AI推理芯片、集群与配套软件栈的协同优化。
陈宁还宣布,公司将联合产业链、科研机构及生态伙伴共同发起“1001计划”,以“百亿Token一分钱”为长期目标,推动Token生成效率和成本的协同优化,使AI算力走向规模化、普惠化应用。他强调,这一计划的重点不在于单纯降低价格,而在于提升性价比,确保在成本下降的同时,每个Token能承载更强的智能、更高的效率和更大的实际价值。
芯片巨头们也在调整策略以适应推理时代的需求。以英伟达为例,其在AI训练时代的Hopper、Blackwell架构专注于单颗芯片性能的提升,但在今年年中全面启动量产的Vera Rubin架构中,英伟达集成了7颗不同芯片,包括CPU、GPU以及从推理芯片厂商Groq处获取的LPU(一种主打超低延迟的NPU)。这一举措被知名半导体研究机构SemiAnalysis视为英伟达补齐推理短板、具有时代指标性质的关键战略。
另一家GPU巨头AMD也在探索系统集成的路线。陈宁认为,过去的重要目标是让一颗芯片像一支队伍一样强大,而现在的重要目标则是如何将不同芯片真正捏合成一支协同发力的队伍。云天励飞在推理芯片领域也采取了类似的策略。
以云天励飞最新公布的三款芯片为例,它们分别针对Prefill、Decode和Decode FFN环节进行了专用优化,并最终组成一个推理集群。Prefill环节主要处理大量文本,对计算能力要求高;Decode环节则利用这些数据生成Token,对内存带宽和数据访问效率更敏感。在MoE模型中,Decode中的“访存密集型”任务Attention容易被带宽限制,而“计算密集型”任务FFN则对算力更敏感。
具体来看,DeepVerse100P是面向百万级上下文Prefill场景的产品,优化了Prefill和Decode“抢资源”的问题,主要应用于企业级AI Coding、长视频生成等场景。DeepVerse100D则专注于Decode环节,重点提升内存带宽和互联效率,降低多节点通信阻塞及尾延迟,适用于大规模AI Chat和Agent应用以及复杂的AI Coding任务。DeepVerse100L聚焦FFN环节,通过3D Memory架构大幅提升内存带宽,并通过低延迟芯片互联和激活数据快速传输提高计算与通信的并行效率,计划应用于复杂的长周期Agent任务中。
这三款针对性优化的芯片最佳用法是共同组成推理集群、多卡超节点,通过集群服务更多样化、大规模的场景,打造极致性价比的推理工厂,构建面向万卡异构集群的分离式AI推理基础设施。陈宁表示,云天励飞发布的推理芯片与集群规划将按照不同推理环节的负载特征配置相应芯片和资源池,并通过高速互联实现协同运行,优化范围由单颗芯片扩展至计算、访存、互联、调度和软件等系统环节。
在今年的WAIC上,Token经济成为热门话题,业界普遍关注AI如何落地兑现经济价值。然而,高昂的Token价格成为AI在垂直产业落地的瓶颈。一方面,AI Coding和Agent的火爆导致推理需求迅速膨胀;另一方面,供给侧算力增长有限,跟不上需求增速。这不仅导致Token价格波动,还引发了Token质量波动的问题。专家认为,如果Token服务继续“野蛮生长”,将影响市场环境,使消费者对Token经济产生负面情绪。
陈宁认为,这个时代呼唤新的算力基础设施。云天励飞发布的推理芯片与集群规划显示,该方案将围绕Token生成全过程对芯片、互联、软件和系统进行协同设计,通过更精细的资源配置提高推理系统的整体效率。他表示,未来三年,公司将沿着这一路线图打造极致性价比的推理生产力,实现AI普惠,推动AI推理芯片、集群与软件体系持续演进。
陈宁分析称,AI算力的衡量标准已从峰值性能延伸至Token生成效率和单位Token成本。对于AI落地而言,真正影响商业化效率的是在一定时间和成本条件下能够稳定生成多少有效Token。他提出了一项大胆计划:将百亿高质量Token的价格打到一分钱。这一计划于今年5月由云天励飞联合联想集团、无问芯穹、生数科技等近30家单位发起“1001计划”联合倡议时提出,引起了广泛关注。
根据陈宁的解释,“1001”有三层含义:目前在最佳AI落地实例中,每百万Token成本为一元钱;云天励飞近期想实现的目标是两年内让百万Token成本降到一分钱;长期目标则是在2030年实现“百亿Token一分钱”。他强调,相关目标的重点在于极致的性价比,而非单纯便宜的价格。他关注的是在成本持续下降的同时,如何让每个Token承载更强的智能、更高的效率和更大的实际价值。
陈宁坦言,大幅降低Token成本无法靠一家公司或一个环节完成,需要芯片、互联、软件、模型、应用及产业链各环节的共同参与。他认为,国产AI目前单点突破能力较强,但在生态建设层面还面临重复适配、上下游反馈链路长、缺少足够多的真实规模化验证等关键卡点。想要建好生态,最关键的是从过去的“逐个适配”走向“共同演进”。
云天励飞表示,接下来将围绕DeepVerse系列芯片和AI集群方案持续建设IFWA软件生态,并通过“1001计划”汇聚产业链上下游力量,建立长期生态合作机制。陈宁称,IFWA和“1001计划”实际上解决的是同一个问题的不同层面:前者希望在软件层降低模型和应用使用国产算力的门槛;后者则希望进一步连接芯片、系统、软件、算力平台、模型、应用以及高校科研机构,让各个环节形成更加紧密的协同。
当前,AI产业正处在转折点上,推理时代的特点是个性化需求的涌现,从芯片到模型、从Agent到应用,专业化分工模式逐渐浮现。通过AI算力基础设施的重构和生态协同的合力,性价比更高的Token将使AI的规模化落地应用成为现实。在人们争相谈论AI落地的这一年,不少AI从业者已经大踏步迈向未来,同时也在思考“AI与人”“AI普惠”的课题。陈宁表示,AI最终不应只是让强者变得更强,而应让更多普通人拥有过去无法拥有的能力,这才是这轮AI革命最有意义的结果。



















