
炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
当下,在存储器成本持续通胀、海外CSP自由现金流开始出现转负的背景下,市场焦点再次转回“AI硬件投资回报率”这一核心问题,7月AI硬件赛道股大幅调整。与上一轮下跌不同,此次大厂资本开支、AI Lab年化收入等核心指标已处在高位,市场交易拥挤度也高于前期。通过在本报告中对单token成本、AI Lab API利润等核心问题研究结论,我们认为AI硬件需求增长依然强劲。


点击小程序查看报告原文
Abstract
摘要
]article_adlist-->硬件成本端,我们认为存储通胀难抵GPU技术迭代增效,单token成本继续快速下降。我们根据NVL72机柜对HBM、DRAM及NAND存储需求占比及价格趋势构建了2025-27年间的存储价格指数,并发现在硬件系统架构持续优化、配套软件栈持续迭代的过程中,存储通胀即便影响Capex有效性,但不改单token成本快速下降趋势。
模型端来看,闭源模型靠溢价、开源模型凭降本,各厂商盈利底座稳固,上游算力硬件需求持续被拉动。尽管当下模型能力快速提升,但市场担忧API价格正以较快幅度下行并侵蚀相关公司盈利。我们认为,1)闭源前沿模型的能力溢价有望持续带来定价权,并对冲高交互强度所带来的硬件成本提升;2)开源模型厂商凭借底层Infra优化压低单位token成本、缩短设备回本周期,在低价竞争中具备更强盈利扩张弹性。整体来看,我们认为硬件需求的“飞轮效应”仍在,国产算力也有望扮演更重要角色。
推理负载结构的精细化有望推动定制化架构芯片落地及系统互联创新。我们看到,随推理应用从传统Chat-only向Agent等转换,AI硬件或通过定制化架构,系统互连优化加速单token降本、或突破延迟与吞吐瓶颈,为实时交互和Agent场景提供性能溢价。我们认为,硬件降本多元化之路开启后有望刺激更多需求。
风险 ]article_adlist-->AI硬件投资回报率不及预期风险,高端产能供给不足、供应链匹配失衡风险,AI应用落地不及预期、场景拓展乏力风险。
Text正文
]article_adlist-->AI硬件投资逻辑未变:存储通胀成本压力与降本力量博弈下,算力需求持续增长
成本端,“存储通胀”跑不赢硬件效率提升速率
本轮“存储通胀”是由AI驱动的结构性刚性需求激增与有纪律的寡头供给收缩叠加所致。举例来看,AI数据中心建设使得服务器DRAM/HBM需求显著抬升,云厂商通过长期合约提前锁定产能,使需求侧呈现高黏性快速扩张特征;而供给侧由三星、SK海力士与美光掌握全球超过90%的DRAM产能,并开始把先进晶圆大比例转向HBM与服务器DRAM,其余应用及传统DDR4被持续挤占,行业库存降至历史低位,而新增产能建设周期长,叠加HBM产线切换的不可逆与扩产克制,供需缺口被放大并持续化。在此格局下,全球DRAM价格出现多季加速上行,且长期合约(LTA)普及弱化了传统周期波动,进一步抬升了价格黏性。NAND方面,AI需求推动下企业级SSD(Enterprise SSD)的需求溢出,而全球NAND存储器上游供给同样被三星、海力士、铠侠、闪迪等寡头控制,行业同样体现出了明显的涨价潮。
图表1:HBM/DDR/NAND单位合约价及预测

资料来源:Bloomberg,TrendForce,中金公司研究部

存储通胀持续抬升资本开支、可能侵蚀资本利用效率,但算力架构迭代驱动的硬件效率提升速率跑赢存储涨价幅度,硬件创新能够持续对冲存储通胀带来的效能损失。我们基于GB200/GB300/VR200三代NVL72机柜迭代路径构建量化测算框架,以1GW算力资本开支为统一标尺,量化存储涨价与硬件算力效率迭代的博弈关系。在存储价格上行周期,存储通胀推升存储板块资本投入,形成“非产能性”额外存储支出,对单位资本开支的Token产出能力构成侵蚀。2026年GB300部署阶段,在170%存储涨价对CapEx的侵蚀下,单位美元可生成Token规模较为显著回落,根据我们的测算,部署GB300 NVL72的单位美元资本开支的Token生成效率较部署GB200下降37%,直观印证了“非产能性”额外存储支出对单位资本开支的Token产出能力的侵蚀。
但长期来看,我们认为算力硬件架构迭代、单GPU吞吐能力跃升带来的效率提升具备更强对冲能力,硬件效率提升幅度将大幅领先于“存储通胀”幅度。伴随VR200平台落地,单卡Token生成速率实现数量级增长,即便存储环节延续涨价趋势,硬件效率提升仍显著修复单位CapEx的Token产出水平。据我们测算,若假设2027年存储均价可能延续同比33%涨幅、存储开支进而上行至80.59亿美元/GW,但是,根据英伟达官网,VR200的吞吐能力比Grace Blackwell NVL72 提升了 10 倍,即硬件架构迭代驱动单GPU的Token吞吐能力大幅上升。硬件原生计算和吞吐效率提升显著抵消存储通胀冲击。根据我们的测算,考虑涨价后部署VR200 NVL72单位美元资本开支的Token产出较部署GB300 NVL72增长268%,大幅领先于该阶段同比33%的平均存储涨价水平。
图表2:基准假设:DSV4模型下不同交互强度对应的硬件成本曲线

注:模型为Deepseek V4 Pro 1.6T
资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
图表3:考虑“存储通胀”影响后的硬件效率提升指标Token/$与“存储通胀幅度”的测算与对比

注:基于DeepSeek V4 Pro 1.6T模型
资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
图表4:各代际NVL72机柜存储配置

资料来源:英伟达官网,中金公司研究部
图表5:硬件架构迭代持续创造增量效率, VR200落地后有效Token/$增速显著跑赢“存储通胀”幅度

注:存储通胀率的计算是基于GB200/GB300/VR200三代NVL72机柜中实际的HBM/LPDDR5X/NAND容量配比的权重,对三类存储的涨价幅度分别赋予各自的权重加权得到各自机柜总的存储通胀率
资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
此外,我们认为长期维度下的CapEx结构具备较强的抗存储涨价韧性。我们可以从另一个视角审视,对比存储累计通胀率(选取2025年为基期)曲线与累计侵蚀率:定义存储涨价对CapEx的侵蚀率=存储涨价新增的“非产能性”存储支出 / 总CapEx,衡量存储涨价对整体资本开支的长期累计挤占程度。我们看到,两条曲线均保持向上趋势,即2026-2027年存储价格较基期的累计涨幅持续扩大,对应的对总CapEx的累计侵蚀也的确在同步加深,但是,累计侵蚀率的上行斜率小于存储通胀的上行斜率,尽管存储自身价格累计涨幅持续走高,新增的非产能性存储支出会被总CapEx里GPU、算力基板、机房基建、互联设备等多品类大额刚性投入充分摊薄,存储涨价向整体资本开支的传导效率被显著弱化,不会出现和存储通胀同幅度的CapEx挤占。根据我们的测算,2026E-2027E存储累计通胀率从约170%达到204%,涨幅增量为34pct;而累计侵蚀率仅从60%平缓上行至接近69%,增量仅9pct。两年间累计侵蚀率始终显著低于同期存储累计通胀率,且差距持续拉大,验证了只要算力资本开支保持多元化的硬件结构,存储环节的价格上行就很难对整体资本规划形成剧烈的冲击,算力平台的架构设计、多组件成本分散特性可以持续对冲存储通胀的累积负面影响。
图表6:相比基期口径下,存储涨价对CapEx的侵蚀率曲线斜率小于存储累计通胀率

注:未来两年存储涨价的累积效应持续增强,但对整体 CapEx 的累计侵蚀呈现温和缓释特征,CapEx 多元化的成本结构有效对冲了存储涨价的累积冲击,长期维度下项目整体资本开支的抗存储涨价韧性较强
资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
图表7:相比上一期口径下,侵蚀率<存储涨价幅度

注:交点左侧,存储涨价幅度 > 侵蚀率,代表景气上行 / 繁荣阶段,尽管价格大幅上涨,但成本压力尚未严重约束下游算力投资;云厂商优先保障 AI 算力落地,愿意承担高价,存储需求韧性充足
资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
即便在同一硬件架构下,推理软件栈持续优化、算力基础设施工程化创新,同样可以对冲成本压力。
图表8:Semi Analysis InferenceX 测试:对比搭载SGLang与NVIDIA Dynamo推理框架的NVIDIA GB300 NVL72系统的单位Token成本及交互并发性能,依托推理软件栈迭代,仅一个月内实现推理性能提升5倍

注:测试模型为DeepSeek V4资料来源:英伟达官网,Semi Analysis,中金公司研究部
收入端,API价格下行不影响大模型厂商维持高GPM水平
我们基于成本端测算得到的每百万token的硬件成本,开展头部模型厂商 API 业务毛利率测算,测算公式为:API 业务毛利率 =(每百万 Token API 售价 - 每百万 Token 硬件资本成本)÷ 每百万 Token API 售价。该测算口径硬件成本端仅扣除硬件资本开支对应的单 Token 成本(即在上文成本端测算的结果),尚未覆盖电力能耗、机房厂房租赁、带宽传输、研发人力、运维、营销、模型版权、数据采购、行政管理等多项经营成本。因此我们认为,本测算得到的毛利率水平天然高于企业合并报表口径的整体毛利率,仅可作为API 业务硬件端边际盈利参考指标。
正品配资平台我们运用Blended Price即混合 API 价格衡量厂商综合收费水平。参考Artificial Analysis,Blended Price采用固定权重加权测算,权重设定为 70% 缓存命中 Token、20% 常规输入 Token、10% 输出 Token,基于各类 Token 对应单价加权求和得出。
图表9:各模型厂商代表性旗舰模型定价情况(API 中枢定价水平)

注:2025 年我们选取 OpenAI GPT-5.2、Anthropic Claude Sonnet 4.6、DeepSeek R1、Moonshot Kimi K2 代表各家 API 中枢定价水平;2026 年选取 OpenAI GPT-5.6 Terra(均衡版)、Anthropic Claude Sonnet 5 Max、DeepSeek V4 Pro、Moonshot Kimi K3 代表各家 API 中枢定价水平,而各家厂商的最前沿模型具有更高的定价水平
资料来源:各公司官网,中金公司研究部
算力硬件持续优化带来的单位 Token 成本下行,是大模型厂商维系 API 业务盈利韧性的核心驱动力。根据我们的测算,2025 年闭源厂商 OpenAI、Anthropic 毛利率处于高位区间,盈利基础扎实;DeepSeek、Moonshot AI毛利率处于60%-70%的区间,与头部闭源厂商存在一定差距。到2026E 阶段,OpenAI、Anthropic 毛利率小幅承压回落;DeepSeek、Moonshot AI毛利率迎来快速上行,不同路线厂商盈利水平持续收敛。在我们假设 2027 年行业 API 统一降价 20% 的情景下,OpenAI、Anthropic、DeepSeek、Moonshot AI等闭源和开源路线的 API 毛利率均实现同比上行。表明硬件迭代、集群架构优化、存储分层、缓存机制落地带来的单 Token 硬件成本降幅,能够充分对冲 API 定价下行带来的收入压力。长期来看,算力硬件端效率提升是大模型服务商维持盈利韧性的关键。
图表10:测算得到的各模型厂商API业务毛利率

注:1)$/mn token成本数据为上文成本端测算的结果,底层模型为Deepseek V4 Pro,本次测算以此来代表所有模型的硬件成本,存在一定的错配问题,但由于数据可得性原因,以Deepseek V4 Pro底层数据近似替代具备一定参考性,因此OpenAI、Anthropic、Moonshot的毛利率推演曲线用虚线列示
资料来源:各公司官网,Semi Analysis,中金公司研究部
成本下降反而可能进一步刺激需求增长,杰文斯悖论(Jevons Paradox)在AI推理领域并未失效。随着模型推理价格降低,用户调用AI服务的边际成本下降,更多应用场景和Agent工作流被激活,推动Token消耗量快速提升。以GPT-5.6 Luna为例,OpenRouter数据显示,模型价格在2026年7月30日OpenAI 宣布下降80%后,其Token调用量从7月30日至8月7日在一周左右增长了约7倍,因此总收入增长了约42%。我们认为该案例表明AI推理成本下降会通过降低AI使用门槛扩大AI应用规模,最终带来更高的Token总需求和收入。
图表11:模型日度Token消耗结构变化(2026.7.10–2026.8.8)

资料来源:OpenRouter,中金公司研究部
前沿模型能力溢价能够对冲高交互(Interactivity)成本压力
前沿高端frontier模型具备稳固定价权,能够有效对冲高交互场景成本上行压力。随着AI从单轮问答走向多步推理、工具调用和agent协同,单次请求所消耗的token确实上升,但客户更关注的是整体任务能否更快、更准地完成,而不是每百万token的静态价格;因此,当模型在coding、agentic execution、long-context reasoning和高可靠性企业工作流中形成可感知的性能代差时,API定价就会从成本加成逻辑转向能力溢价逻辑。具体来看,Anthropic Claude Fable 5的input/output定价分别升至10/50美元/百万token,较前代Claude Opus 4.8翻倍;OpenAI GPT-5.6 Sol维持5/30美元,明显具有一定的价格刚性;xAI Grok4.5较前代input/output分别上涨60%/140%。
进一步看,interactivity提升带来的成本上升并不必然压缩盈利,关键在于收入端是否同步“按结果”重新定价(若能够落地按任务结果定价的新型收费机制,则可将算力与内存增量成本向客户端传导,维持盈利稳定)。多步Agent系统会增加token消耗,且reasoning、MoE、RLVR等技术路径会推高单次响应token用量。但若模型可替代更高单价的人类劳动、缩短开发周期、减少错误率并提高任务完成率,企业愿意接受更高API单价乃至usage-based billing、metered billing、success-based pricing等更强变现机制。我们认为,成本端上升是“复杂任务”的函数,而收入端上升是“高经济价值”的函数,对于frontier模型,后者在高价值场景中可以覆盖前者。
图表12:前沿模型能力溢价能够对冲高交互(Interactivity)成本压力

资料来源:Bain analysis,中金公司研究部
开源模型厂商凭借底层算力架构与推理调度系统优化压低单位 Token 成本、缩短设备回本周期,在低价竞争中具备更强盈利扩张弹性
相较闭源厂商需要以高售价覆盖更重的训练摊销、品牌溢价和更复杂的全栈服务成本,开源/开放权重模型厂商的核心盈利杠杆更偏向基础设施效率红利,其利润改善的弹性来自成本陡降而非价格上涨。以DeepSeek为例,公司围绕推理全链路完成了系统级自研优化,一方面,以MoE原生架构降低单token实际激活参数量,配合Flash MLA、KV Cache压缩、异构KV多级存储、Engram存算分离、PD分离与双路径调度,显著压缩HBM占用、提升GPU吞吐并降低单位推理成本;其中DSpark可将V4的单用户生成速度提升57%-85%,Flash MLA将内存消耗再降低40%-60%,DeepSeek推理方案还通过3FS与KV Cache多级存储使服务成本下降90%,V4长上下文下累计KV Cache在1024k序列长度时仅约5GB,显著低于V3.2的接近50GB。另一方面,公司将这些底层优化直接映射到商业模式,管理层以10个月收回设备成本作为API定价上限,而硬件会计折旧期通常为3-5年,单台设备在账面寿命早期即可完成现金回收,随后长尾期形成高质量现金贡献。因此,DeepSeek才能在2026年以低价持续扩大份额,在V4-Pro输出价格仅为海外frontier模型的2%-14%的现实下仍实现我们测算得到的50%+至70%-80%毛利率。开源路线并不必然削弱盈利,反而由于模型可开放、收入更多转向托管推理、云分发与工作流变现,厂商有机会在低价放量、高利用率、成本再降、毛利再扩的正反馈中实现更强盈利修复。
图表13:开源大模型能力追赶闭源模型,能力差距持续收窄

注:从时间差距来看,过去开源模型追赶闭源模型所需的12–18个月周期,如今已压缩至约6–9个月,而且这一追赶窗口仍在持续缩短。从同一时间模型差距来看,开源模型追赶窗口持续收窄。2024年初,开源与闭源模型能力差距达到15–20分的高点,随后受益于中国AI实验室快速迭代,模型能力差距加速收敛。2025年DeepSeek R1成为关键拐点,其以更低训练成本实现接近ChatGPT级推理能力,推动开源模型进入快速追赶阶段。截至2025–2026年,最佳开源模型与闭源模型质量差距已缩小至约7分,较此前缩短约一半
资料来源:ghuneim.us,中金公司研究部
开源路线缩小性能差距、下调API价格、拓宽部署场景,带动Token需求高速扩张,利好全链路AI硬件及国产算力产业链
中长期看,开源模型路线会通过持续缩小能力差距、压低调用价格和扩大部署形态,重构AI的需求函数,使Token消耗变为一种生产要素,抬升算力与半导体硬件的总需求。从供给侧看,开源模型的参数规模仍在快速膨胀,DeepSeek-V3、KimiK2、DeepSeek-V4-Pro、KimiK3已分别达到671B、1T、1.6T、2.8T参数;此外,开源模型在多场景部署、企业私有化、自托管和二次开发上的优势,使更多企业能够不依赖单一闭源API直接形成新的端点与本地内存占用。价格侧,国内模型过去两年API价格经历持续下探,2026年5月DeepSeek将V4-Pro永久调整为原定价的1/4,MiMo-V2.5最高降价99%,同等付费Token用量可提升5-8倍,直接降低了中小企业与开发者的试错成本和接入门槛。需求侧,中国公有云大模型Token消耗量2024/2025年分别为114 / 1,944万亿,IDC预计2026年增长至40,000万亿。价格下降并未导致产业价值收缩,反而显著提升了调用频率、部署节点数和推理负载强度,尤其在agent、多轮交互、长上下文和企业流程嵌入场景下,Token需求与存储/带宽需求同步上行。因此,长期受益的是承载Token爆发的底层硬件体系,在中国市场,自主可控叠加本土TCO优势又进一步推动需求向国产GPU、国产存储、国产服务器与国产互联方案迁移。
总结来看,硬件快速迭代保障了模型厂商的盈利水平不会被存储通胀侵蚀,且前沿模型能力溢价能够对冲高交互(Interactivity)成本压力,我们将上文整体分析总结如下图所示。
图表14:AI算力产业链成本收入博弈链路

资料来源:TrendForce,Semi Analysis,Bloomberg,英伟达官网,中金公司研究部
在此盈利基本面之上,我们认为进一步落地大规模算力资本开支还需要两大现实条件:真实下游算力需求承接、资本扩张不会引发系统性信用风险:
► 从资本开支的角度,资本开支本质上取决于两个问题,其一,新增算力是否有需求;其二,新增算力是否能以合理价格变现。当前两者都在改善。需求端,AI已从Chatbot进入agent阶段,tokens调用和推理链长度同步上升,且多agent协作将进一步放大推理需求。变现端,云业务首当其冲:我们看到Google Cloud、Azure、AWS等云业务均在AI需求拉动下加速增长。微软FY26Q4 Azure及其他云服务收入同比+43%、全年Azure收入首次超过1000亿美元,Google Cloud 2026Q2收入同比+82%至248亿美元,营业利润率由20.7%升至35.6%,积压订单升至5140亿美元。当云厂商看到前沿模型与企业AI工作负载能以较高价格快速转化为收入时,其对上游GPU、数据中心、电力和网络的投入意愿自然增强。云业务的高速增长不仅表明算力租赁需求旺盛,我们认为云商业模式正在从单一IaaS出租,进一步升级为多层变现体系。现阶段AI云收入中GPU租赁仍约占50%,但MaaS/API是增长最快的部分,例如阿里云百炼MaaS平台API Token需求增速极快,对比2025年11-12月,2026年5-6月的调用量已增长十倍以上,阿里巴巴CEO吴泳铭预计6月季度内AI模型与应用服务年化经常性收入(ARR)将突破100亿元,阿里云MaaS业务的Token收入在2026年前5个月增长15倍[1],月度Token收入已达数亿元级别。而工具链产品毛利率可达60%-80%[2],正在带动单位token对应的平台收入密度持续提升。
图表15:谷歌云2025Q2、2026Q2营收与营业利润变化

资料来源:Alphabet,中金公司研究部
► 从信用风险视角看,我们认为市场对CapEx失控导致债务恶化的担忧目前并不成立。海外龙头仍具备很强的融资与偿债能力,高评级、低净杠杆、大额EBITDA和深厚债市接纳度,使其债务风险显著低于传统重资产扩张周期中的高杠杆主体。决定信用安全边际的不是capex绝对金额,而是投入资产的预期回报率与现金流回收能力。只要frontier模型的能力溢价能够支撑更高收入单价,资本开支回报的核心矛盾就不在于单位token的成本略升,而在于单位算力产出的收入密度能否持续抬升。
AI芯片架构创新:ASIC优化Token成本,高性能片打开Premium AI空间
片内优化:以差异化芯片架构寻求时延-吞吐曲线的最佳位置
随着模型能力提升,我们认为市场正在形成不同应用场景:
· Mass AI:对应普通问答、低价值调用场景,更加关注最低Token成本,成本敏感;
· Premium AI:对应Coding Agent、企业Agent、实时交互场景,更加关注响应速度和任务完成效率,性能敏感。
因此,我们认为未来推理芯片竞争将沿两个维度展开:一类通过专用架构优化单位Token成本,提升资本效率,如TPU,Trainium,MTIA;另一类通过架构创新突破延迟与吞吐瓶颈,为实时交互和Agent场景提供性能溢价,如Cerebras,Groq。不同的芯片适用于不同的时延-吞吐曲线位置,并带来更好的成本优化,具体的评价标准及优势我们将在下文中进行分析。
思考框架:摒弃单 Token 成本、峰值算力等片面指标,以帕累托曲线评判芯片全负载 TCO 综合能力
针对上述推理场景不断精细化的论述,我们认为用单一指标(单 Token 成本、峰值 FLOPS、时延、吞吐)衡量推理系统的TCO存在片面性,可以依托时延 - 吞吐帕累托前沿(Pareto Frontier)曲线完成多维度综合权衡。所谓帕累托最优前沿,指曲线上每一个点位都达成时延与吞吐的最优均衡,无法在不牺牲其中一项性能的前提下提升另一项指标。推理芯片帕累托曲线的横轴、纵轴是时延、吞吐两大性能结果,推理芯片的算力吞吐、显存带宽(核心支撑 KV Cache 读写)、整机调度引擎三大底层硬件能力可以共同决定帕累托曲线的高低、左右、平滑走势。从下图可以清晰看到,所有部署方案都存在时延与吞吐的天然取舍关系:左侧区域时延更优但吞吐偏低,右侧区域吞吐提升却会牺牲响应速度,只有落在帕累托前沿上的点才不存在性能浪费。
图表16:推理的时延 - 吞吐帕累托最优前沿曲线示意图

资料来源:Semi Analysis,中金公司研究部
图表17:英伟达GenAI-Perf 压测工具:依托帕累托前沿曲线,以业务时延上限过滤无效负载,锁定最优推理工作点

注:横轴为平均首 Token 生成时延(TTFT),纵轴为每秒请求吞吐;红线划定 250ms 业务时延合格阈值,红线右侧区域标注为 “不合规(Ineligible)”,代表超出交互体验上限的负载工况;绿色箭头指向 100 并发点位,是在满足时延约束前提下吞吐表现最优的帕累托最优工作点。
资料来源:英伟达官网,中金公司研究部
英伟达为客户提供工具,用帕累托曲线找TCO最优的推理部署方案。英伟达官方技术博客《大模型推理基准测试:你的大模型推理成本究竟是多少》明确指出,评估推理成本不能只依靠单一项指标片面判断,时延、吞吐、显存占用、模型精度、硬件规格等多个指标存在天然取舍关系,可以依托帕累托前沿曲线综合权衡;文章配套英伟达 GenAI-Perf 压测工具,给出了完整落地流程:先完成业务负载基准测试,生成多维度性能数据绘制帕累托曲线,在业务时延 SLO 约束下筛选同等延迟下吞吐最高的最优部署方案,同时结合硬件折旧、托管、软件授权搭建 TCO 核算模型,根据对话、代码、智能体等不同推理场景测算服务器部署规模与单 Token 综合成本,形成一套标准化、可落地的推理负载选型与成本优化方法论。
需求方向:具备左上偏移、高负载衰减平缓帕累托前沿曲线的推理芯片,系统 TCO 表现更优
我们认为判断推理芯片实力不能只看纸面峰值算力 FLOPS,而要看在业务规定的时延 SLO 约束下,能跑出更靠左、更靠上、走势平滑的帕累托前沿曲线,在吞吐与延迟之间达成全局最优均衡。我们认为优质的推理场景帕累托前沿曲线应当整体更靠左上、右侧下降趋势平缓:曲线左上代表同等时延约束下可实现更高吞吐,能在满足业务交互体验阈值的同时最大化单卡算力产出、摊薄单位 Token 成本;而曲线右侧下降平缓意味着面对智能体、长上下文等高并发、高 Token 消耗的重度推理负载时,吞吐性能不会随时延拉长快速断崖下滑,硬件架构在高负载区间依旧能维持稳定算力效率,大幅缓解 KV 缓存膨胀、多轮工具调用带来的算力损耗,从全场景维度降低整体推理 TCO。因此,帕累托前沿曲线整体左上偏移、高负载区间性能衰减平缓的推理芯片,全负载工况下吞吐表现更强,承载同等业务流量所需服务器数量更少,系统整体 TCO 更优;反之曲线偏右下、高并发段吞吐断崖下滑的芯片,完成相同业务负载需部署更多硬件,推理全生命周期成本将显著抬升。
不同AI负载在算力、存储、网络、时延等维度的诉求存在拉扯错位,同一芯片在不同负载的资源约束下形成不同帕累托前沿曲线
根据Meta提供的不同AI负载需求雷达图,评估推理芯片不能只看峰值算力,雷达图清晰展现各类 AI 工作负载资源需求的分化:LLM 训练重度消耗峰值算力、HBM 显存与集群网络;推理 Prefill 阶段算力需求最突出;Decode 生成阶段高度依赖显存带宽,同时对延迟极度敏感;推荐排序训练侧重 Embedding 向量计算与大规模数据搬运,推荐在线推理环节的核心追求则是低延迟与高并发吞吐。不同任务在算力、存储、网络、时延维度诉求拉扯错位,不存在一套硬件架构可适配全部场景,必须结合实际业务负载综合评判。
帕累托前沿的本质是在约束下的最优折中曲线,而雷达图刻画的是不同负载的资源瓶颈,在不同的资源瓶颈下,AI算力芯片的系统最优吞吐-延迟帕累托前沿也不同。在推理系统里,帕累托前沿可以理解为在给定硬件与软件栈下,无法同时继续提升吞吐(Throughput)和降低延迟(Latency)的极限边界。对于 Prefill 这类并行度较高的任务,系统可以通过更大 batch 和更高并发换取吞吐提升;而 Decode、推荐在线推理这类延迟敏感任务,最优点往往受显存带宽、KV Cache 访问、网络跳数和调度开销约束,难以单纯依靠堆算力提升吞吐。也就是说,不同负载对应不同的帕累托曲线,同一套硬件在不同模型结构、上下文长度、batch size、并发量和调度策略下,最优工作点也会发生移动。这个最优工作点最终决定单 token 处理成本和集群整体 TCO。因此,推理芯片竞争不是峰值算力竞争,而是能否在目标负载下,通过计算、显存、互联、调度和软件栈协同,把系统推到更优的吞吐、延迟和成本组合。
图表18:多维资源约束空间下,不同 AI 负载的资源需求差异雷达图

资料来源:Meta,中金公司研究部
特别的,由于存储器本身通胀难以消除,芯片设计企业开始沿着优化存储器-计算单元数据流来获得更强的系统效率,传统GPU主要依赖HBM扩展外部存储带宽,以支持大规模模型运行;而部分新型架构则通过增加片上SRAM容量、优化数据流动路径或减少芯片间通信,降低模型执行过程中的数据搬运开销。目前市场的AI推理芯片围绕容量、带宽、时延与成本之间的权衡,形成了四类差异化存储路线:第一类是以Groq和Cerebras为代表的SRAM中心架构,通过将存储尽可能集成在芯片内部,以高带宽、低时延减少数据搬运,其中Groq依靠230MB片上SRAM与确定性数据流优化低延迟Decode,Cerebras则通过晶圆级集成44GB SRAM并结合MemoryX权重流式传输支持大型模型,但代价是芯片面积和系统成本较高,计算方式也相对固定;第二类是以d-Matrix和Tenstorrent为代表的“SRAM+低成本DRAM”路线,通过LPDDR5X或GDDR6替代部分HBM需求,在保持一定容量和可编程性的同时,绕开HBM供给紧张及CoWoS先进封装瓶颈,降低系统成本与供应链风险;第三类是以SambaNova和Positron为代表的分层存储架构,通过SRAM、HBM与DDR协同,将高频数据、当前模型及待调用模型部署在不同存储层级,在容量、带宽、成本和模型切换效率之间取得平衡,更适合Agent频繁调用多个模型的场景;第四类是以Rebellions、FuriosaAI、Etched和MatX为代表的HBM中心架构,依靠大容量、高带宽HBM承载大模型推理,并通过CGRA、张量收缩处理或专用ASIC等不同程度的计算专用化提升效率,但过度固定的硬件结构可能削弱对新模型架构的适应能力,因此行业可能逐步向“存储以HBM为核心、计算部分固定且部分可重构”的折中形态收敛。
正如上文所述,不同计算架构与存储架构在算力利用率、数据搬运效率、内存容量和带宽约束上存在显著差异,因此会形成不同的成本函数,并对应不同形态的吞吐—延迟帕累托曲线。最终,架构竞争力将体现为能否在目标负载下将帕累托前沿进一步向外推移,并实现更低的单位Token成本、更高的能效以及更优的系统级TCO。
图表19:AI推理芯片通过差异化存储架构与可编程能力适配不同负载瓶颈

资料来源:Damnang’s Substack,中金公司研究部
片外互联+存储共同优化,对冲算力基础设施成本压力
互联级NVLink/高速网络:通过提高集群协同效率,减少存储碎片化与闲置
当前算力集群普遍存在存储通胀、有效算力不足的结构性矛盾,原因是互联能力受限。
高强度互联能力是破解该矛盾的关键。通过升级高速互联体系,可实现多GPU、多节点算力与存储资源的全域打通、统一调度与共享复用,最大化挖掘每单位高速内存的算力价值,大幅提升集群整体资源利用率与业务承载效率。
NVIDIA以NVLink高速互联体系为核心,构建了集群资源池化的底层技术底座。该技术体系提升了物理连接数量,重构了多GPU分散的计算、内存资源,将碎片化的单卡硬件集群重塑为逻辑统一的一体化加速器系统。
系统架构级CXL:通过内存池化与分层存储,降低对HBM的刚性依赖
存储通胀会恶化AI CapEx效率的原因是 HBM层承担了过多本可下沉的容量需求。尤其在Agentic AI、长上下文推理、多轮对话和RAG场景中,KV Cache、上下文状态与中间结果会急剧推高内存容量需求。如果没有新的内存分层方案,系统就只能继续堆更昂贵的HBM/DRAM。
CXL协议在PCIe物理层之上建立缓存一致的内存互联,目的是为了CPU、GPU、加速器与内存设备之间提供高带宽、低延迟、缓存一致的数据交换能力。其通过memory expansion、memory pooling、coherent access,把内存从绑定在单个CPU/GPU上的“固定资产”,变成可共享、可扩展、可分层的系统资源。
前沿模型如Fable 5和GPT-5.6 Sol持续迭代,将AI基础设施的核心矛盾聚焦于内存容量瓶颈。
因此,对Frontier前沿模型,CXL技术推动AI系统内存由单卡附属资源,升级为机架级、池化、分层调度的系统级核心资源,具备显著必要性。Frontier模型对大容量可寻址内存空间存在刚性需求,但并非全部数据均需存放于稀缺、高成本的HBM。行业可行的分层存储路径为:热数据驻留HBM,温数据下沉至CXL DRAM池化内存,冷数据进一步下沉至SSD。该架构无需线性加码GPU与HBM资本投入,即可持续承载百万Token上下文、长周期智能体任务及记忆型推理场景的扩张需求。
图表20:基于CXL架构的内存与存储技术

资料来源:Yolo,中金公司研究部
OpenAI与Cerebras合作显示,高性能推理芯片开始进入Frontier Model生态
随着模型能力提升,前沿模型(Frontier Model)相比开源及成本优化模型仍保持明显价格溢价,体现市场对于更强推理能力和任务完成效率的付费意愿。目前GPT-5.6 Sol、Claude Opus等领先模型API价格仍维持在约15–30美元/百万Output Tokens,Claude Fable 5官方API Output价格达到50美元/百万Output Tokens,明显高于开源模型和成本优化型模型。
对于追求更高任务完成质量和业务价值的Premium AI客户,其核心诉求并非单纯降低Token成本,而是通过更强模型能力提升复杂任务处理效率。前沿模型能够强化复杂长链条推理能力,提升高价值知识任务输出质量;降低AI应用二次开发成本,加速业务规模化落地;并支撑生产级自治智能体运行,解锁新的自动化业务流程。因此,在Premium AI应用场景中,客户对于模型性能和基础设施成本具有更高承受能力。
图表21:前沿模型凭借更强能力维持高Token价格,形成AI服务的Premium市场

注:图中价格为模型API Output Token价格(美元/百万Output Tokens)。MMLU-Pro 即大规模多任务语言理解评测,是用于评估大语言模型能力的基准测试
资料来源:Bain analysis,中金公司研究部
以Cerebras为代表的新型推理芯片,并非简单追求最低成本,而是通过架构创新提升推理性能。Cerebras WSE架构将大规模计算核心和SRAM集成于晶圆级芯片,减少GPU多芯片之间的数据通信,提升Decode阶段Token生成速度。在Artificial Analysis测试中,Cerebras在部分模型推理任务中实现远高于传统GPU云服务的Output Speed。下图中可以看到,Cerebras等芯片位于高速度区域,虽然价格并非最低,但凭借高吞吐和低延迟形成差异化优势。对于Coding Agent、实时AI助手等应用,更快响应速度能够直接提升用户体验,并可能转化为更高商业价值,因此客户愿意支付一定硬件溢价。OpenAI与Cerebras的合作进一步验证了高性能推理芯片在Frontier Model场景中的价值。作为OpenAI面向复杂推理任务的Frontier Model(前沿模型),GPT-5.6 Sol已支持在Cerebras平台运行,可实现最高约750 tokens/s的输出速度(较非Cerebras版本提升约10倍)。该合作表明,对于GPT-5.6 Sol等高价值Frontier Model,推理服务竞争并非仅关注最低Token成本,而是通过更高吞吐、更低延迟提升实时交互体验,因此客户愿意支付一定硬件溢价,从而支撑高性能定制芯片的商业化。
图表22:不同推理服务商在“低延迟、高吞吐”空间中的 Pareto 优势区域

注:Cerebras凭借高Token生成速度进入低延迟、高交互推理区域
资料来源:Artificial Analysis,Cambrian AI Research,中金公司研究部
图表23:专用推理芯片凭借高吞吐性能打开AI推理服务差异化空间

注:图中横轴为模型推理服务价格(美元/百万Token),纵轴为输出速度(Output Tokens/s),基于GPT-OSS-120B模型测试结果。Cerebras等专用推理芯片虽然单位Token价格并非最低,但凭借更高输出吞吐和更低延迟进入性能优势区域,体现高价值AI应用场景下用户对推理性能的付费能力。
资料来源:Artificial Analysis,中金公司研究部
风险提示 ]article_adlist-->► AI硬件投资回报率不及预期风险。
元股证券:ygzq.hk► 高端产能供给不足、供应链匹配失衡风险。
► AI应用落地不及预期、场景拓展乏力风险。
[1]https://eu.36kr.com/zh/p/3819955387371649
[2]https://pdf.marketpublishers.com/globalinfo/global-ai-native-application-development-tools-market-gir.pdf
Source文章来源
]article_adlist-->本文摘自:2026年8月10日已经发布的《AI进化论(22):无惧存储通胀,下游盈利健康,多元降本重构AI硬件投资叙事》
成乔升 分析员 SAC 执证编号:S0080521060004
于新彦 分析员 SAC 执证编号:S0080524080007
彭虎 分析员 SAC 执证编号:S0080521020001 SFC CE Ref:BRE806
贾顺鹤 分析员 SAC 执证编号:S0080522060002
Legal Disclaimer法律声明
特别提示
本公众号不是中国国际金融股份有限公司(下称“中金公司”)研究报告的发布平台。本公众号只是转发中金公司已发布研究报告的部分观点,订阅者若使用本公众号所载资料,有可能会因缺乏对完整报告的了解或缺乏相关的解读而对资料中的关键假设、评级、目标价等内容产生理解上的歧义。订阅者如使用本资料,须寻求专业投资顾问的指导及解读。
本公众号所载信息、意见不构成所述证券或金融工具买卖的出价或征价,评级、目标价、估值、盈利预测等分析判断亦不构成对具体证券或金融工具在具体价位、具体时点、具体市场表现的投资建议。该等信息、意见在任何时候均不构成对任何人的具有针对性的、指导具体投资的操作意见,订阅者应当对本公众号中的信息和意见进行评估,根据自身情况自主做出投资决策并自行承担投资风险。
中金公司对本公众号所载资料的准确性、可靠性、时效性及完整性不作任何明示或暗示的保证。对依据或者使用本公众号所载资料所造成的任何后果,中金公司及/或其关联人员均不承担任何形式的责任。
本公众号仅面向中金公司中国内地客户,任何不符合前述条件的订阅者,敬请订阅前自行评估接收订阅内容的适当性。订阅本公众号不构成任何合同或承诺的基础,中金公司不因任何单纯订阅本公众号的行为而将订阅人视为中金公司的客户。
一般声明
本公众号仅是转发中金公司已发布报告的部分观点,所载盈利预测、目标价格、评级、估值等观点的给予是基于一系列的假设和前提条件,订阅者只有在了解相关报告中的全部信息基础上,才可能对相关观点形成比较全面的认识。如欲了解完整观点,应参见中金研究网站(http://research.cicc.com)所载完整报告。
本资料较之中金公司正式发布的报告存在延时转发的情况,并有可能因报告发布日之后的情势或其他因素的变更而不再准确或失效。本资料所载意见、评估及预测仅为报告出具日的观点和判断。该等意见、评估及预测无需通知即可随时更改。证券或金融工具的价格或价值走势可能受各种因素影响,过往的表现不应作为日后表现的预示和担保。在不同时期,中金公司可能会发出与本资料所载意见、评估及预测不一致的研究报告。中金公司的销售人员、交易人员以及其他专业人士可能会依据不同假设和标准、采用不同的分析方法而口头或书面发表与本资料意见不一致的市场评论和/或交易观点。
在法律许可的情况下,中金公司可能与本资料中提及公司正在建立或争取建立业务关系或服务关系。因此,订阅者应当考虑到中金公司及/或其相关人员可能存在影响本资料观点客观性的潜在利益冲突。与本资料相关的披露信息请访问http://research.cicc.com/disclosure_cn,亦可参见近期已发布的关于相关公司的具体研究报告。
本订阅号是由中金公司研究部建立并维护的官方订阅号。本订阅号中所有资料的版权均为中金公司所有,未经书面许可任何机构和个人不得以任何形式转发、转载、翻版、复制、刊登、发表、修改、仿制或引用本订阅号中的内容。

海量资讯、精准解读,尽在新浪财经APP
配资之家提示:本文来自互联网,不代表本网站观点。