本文所有数据均来自 DeepSeek 官方定价页、公开报道和 DeepSeek 开源周公布的实测数据,不构成投资建议。


一、引子

上个月 DeepSeek 宣布 V4 系列 API 永久降价,V4-Pro 输出定价低至 6 元/百万 tokens,V4 Flash 更是降到 2 元/百万。业内叫它「电费级定价」。

但很少有人认真算过:这个定价下,一张显卡跑到报废到底能产生多少收入?够不够把显卡本身的钱赚回来?

我花了半小时,把这事算清楚了。结论很有意思——单卡亏钱,集群赚钱。中间的差值就是 AI 算力生意最核心的门槛。


二、先定参数

算账之前,先确定输入条件。

显卡

用的是 NVIDIA H800 80GB——这是国内 AI 训练和推理最主流的数据中心 GPU,也是 DeepSeek V3/V4 训练用的卡。

  • 单卡价格:约 ¥250,000(禁令前报价 21 万,现在约 25-30 万)
  • 推理寿命:4 年(数据中心 GPU 在推理负载下约 3-5 年,取中值)

定价

DeepSeek V4 Flash 的定价为准(来自 api-docs.deepseek.com 官方定价页):

项目 价格
输出 2 元/百万 tokens
输入(缓存命中) 0.02 元/百万
输入(缓存未命中) 1 元/百万

吞吐

吞吐量分两个场景取值。孤立单卡用保守估计,集群用 DeepSeek 开源周公布的实际生产数据。


三、第一笔账:单张显卡孤立运行

假设你往机房里插了一张 H800,拉了条网线,开始对外卖 API。

因为没有规模效应,你面临三个限制: 1. 并发低——偶尔来几个请求,GPU 大部分时间在空转 2. 缓存命中率低——每来一个用户都是新的 cache miss 3. 批处理效果差——batch size 上不去,吞吐受限

指标 取值
输出吞吐 500 tokens/秒
GPU 利用率 50%
缓存命中率 50%

4 年总计算量:

输出 = 500 × 35,040h × 3,600s = 63,072,000,000 tokens
输入 = 输出 × 3(典型输入输出比) = 189,216,000,000 tokens

收入:

输出收入 = 63,072 × 2 元/百万 = ¥126,144
缓存命中输入 = 94,608 × 0.02 元/百万 = ¥1,892
缓存未命中输入 = 94,608 × 1 元/百万 = ¥94,608
输入总收入 = ¥96,500

总账:

项目 金额
总收入 ¥222,644
显卡成本 -¥250,000
净盈亏 -¥27,356(亏)

一张 H800 单打独斗跑 4 年,亏两万七。

这个结果其实不意外——DeepSeek 说的「电费级定价」在单卡场景下是字面意思:收入确实只够付电费,连卡钱都回不了本。


四、第二笔账:两千张卡的集群

现在换一个场景:你的机房里有两千张 H800,每天有几百万用户在调用。

规模效应带来了几个质变:

  1. 高并发填满 GPU——请求永远在排队,GPU 利用率从 50% 拉到 85%
  2. 连续批处理——batch size 翻了好几倍,吞吐量大幅提升
  3. 缓存命中率飙升——热门 prompt 在集群中被反复命中,缓存命中率从 50% 升到 80%
  4. PagedAttention 等优化技术——显存利用率从 40% 提升到 90%+

这些不是理论推测。DeepSeek 在 2025 年开源周公布了实测数据:

单 H800 节点输出吞吐 14,800 tokens/秒(8 卡 DGX 节点,折合单卡约 1,850 tokens/秒)。输入吞吐 73,700 tokens/秒(折合单卡约 9,200 tokens/秒)。

指标 孤立单卡 集群规模化
输出吞吐 500 t/s 1,850 t/s
GPU 利用率 50% 85%
缓存命中率 50% 80%
有效吞吐倍率 1x ~4x

4 年总计算量(每张卡):

输出 = 1,850 × 0.85 × 35,040h × 3,600s = 198,468,000,000 tokens
输入 = 9,200 × 0.85 × 35,040h × 3,600s = 986,861,000,000 tokens

收入:

输出收入 = 198,468 × 2 元/百万 = ¥396,936
缓存命中输入 = 789,489 × 0.02 元/百万 = ¥15,790
缓存未命中输入 = 197,372 × 1 元/百万 = ¥197,372
输入总收入 = ¥213,162

但 GPU 不能单独工作——它需要插在服务器里,接上网卡,吹着空调。这些基础设施成本也要算进去。

成本项(4 年摊薄) 金额
显卡 ¥250,000
服务器分摊(8 卡节点 ÷ 8) ¥75,000
InfiniBand 网络 ¥30,000
电费(500W × ¥0.8/kWh) ¥14,000
散热 ¥10,000
机房机位 ¥20,000
总成本 ¥399,000

最终总账:

项目 孤立单卡 集群规模化
总收入 ¥222,644 ¥610,098
总成本 ¥250,000 ¥399,000
净盈亏 -¥27,000(亏) +¥211,000(赚)
ROI -11% +53%
年化回报 ~11%/年

五、这张账告诉我们什么

1. 规模不是锦上添花,是生存门槛

单卡亏 2.7 万,集群单卡赚 21 万——相差近 24 万。这个差值就是规模效应的实际货币化。

对买了几百张卡的中小公司来说,他们的 GPU 利用率可能不到 60%,batch size 上不去,缓存命不中——实际上是在孤立单卡的区间运营,大概率亏钱

对 DeepSeek、字节、阿里这种上万卡集群的大厂来说,把每张卡的吞吐推到 4 倍,就能在电费级定价下还能有 10%+ 的年化回报。

2. DeepSeek 定价策略的深层逻辑

「电费级定价」不是慈善,是一张准入门票。它定了一个其他玩家很难跟的价格。

小厂如果跟这个价——亏钱。 大厂如果跟这个价——赚少一点,但能活。

AI 价格战的本质不是价格战本身,是规模能力的分化。谁的 GPU 多、利用率高、吞吐优化做得好,谁才能在低价下盈利。

3. 一个有趣的推论

如果把 DeepSeek V3 的训练也按这个逻辑算:

场景 耗时
2,048 张 H800 训练 V3 55 天
1 张 H800 训练 V3 318 年
1 张 H800 推理到报废 4 年

同样的硬件,在它寿命内能推理的数据量是训练用数据量的 100 倍

这就是为什么 GPU 厂商更愿意卖推理算力——推理是印钞机模式,训练是一锤子买卖。 训练再暴利也是一次性收入,但推理是按 token 持续收费的 annuity stream。


六、局限

这个计算做了几个简化假设:

  1. 定价稳定——假设 4 年内 DeepSeek V4 Flash 的定价不调整。现实是 AI 模型价格还在快速下降
  2. 利用率恒定——假设 4 年里的 GPU 利用率不变化。现实是需求波动很大
  3. 未计入人力成本——运营几千张卡的集群需要工程师团队,这笔开销不低
  4. 单模型假设——假设卡只跑一个模型。现实中集群通常混跑多个模型

这些假设都偏乐观——如果全部修正,实际利润会比 21 万更低。但结论的方向不变:规模化是把亏钱生意变成赚钱生意的必要条件。


附:数据来源

  • DeepSeek 官方定价页:api-docs.deepseek.com
  • DeepSeek 开源周(FlashMLA)实测吞吐数据
  • 中关村在线、3DM 等关于数据中心 GPU 寿命的报道
  • 机电之家等 H800 报价(2026 年 5 月)