一张显卡在报废之前能赚多少钱
本文所有数据均来自 DeepSeek 官方定价页、公开报道和 DeepSeek 开源周公布的实测数据,不构成投资建议。
一、引子
上个月 DeepSeek 宣布 V4 系列 API 永久降价,V4-Pro 输出定价低至 6 元/百万 tokens,V4 Flash 更是降到 2 元/百万。业内叫它「电费级定价」。
但很少有人认真算过:这个定价下,一张显卡跑到报废到底能产生多少收入?够不够把显卡本身的钱赚回来?
我花了半小时,把这事算清楚了。结论很有意思——单卡亏钱,集群赚钱。中间的差值就是 AI 算力生意最核心的门槛。
二、先定参数
算账之前,先确定输入条件。
显卡
用的是 NVIDIA H800 80GB——这是国内 AI 训练和推理最主流的数据中心 GPU,也是 DeepSeek V3/V4 训练用的卡。
- 单卡价格:约 ¥250,000(禁令前报价 21 万,现在约 25-30 万)
- 推理寿命:4 年(数据中心 GPU 在推理负载下约 3-5 年,取中值)
定价
以 DeepSeek V4 Flash 的定价为准(来自 api-docs.deepseek.com 官方定价页):
| 项目 | 价格 |
|---|---|
| 输出 | 2 元/百万 tokens |
| 输入(缓存命中) | 0.02 元/百万 |
| 输入(缓存未命中) | 1 元/百万 |
吞吐
吞吐量分两个场景取值。孤立单卡用保守估计,集群用 DeepSeek 开源周公布的实际生产数据。
三、第一笔账:单张显卡孤立运行
假设你往机房里插了一张 H800,拉了条网线,开始对外卖 API。
因为没有规模效应,你面临三个限制: 1. 并发低——偶尔来几个请求,GPU 大部分时间在空转 2. 缓存命中率低——每来一个用户都是新的 cache miss 3. 批处理效果差——batch size 上不去,吞吐受限
| 指标 | 取值 |
|---|---|
| 输出吞吐 | 500 tokens/秒 |
| GPU 利用率 | 50% |
| 缓存命中率 | 50% |
4 年总计算量:
输出 = 500 × 35,040h × 3,600s = 63,072,000,000 tokens
输入 = 输出 × 3(典型输入输出比) = 189,216,000,000 tokens
收入:
输出收入 = 63,072 × 2 元/百万 = ¥126,144
缓存命中输入 = 94,608 × 0.02 元/百万 = ¥1,892
缓存未命中输入 = 94,608 × 1 元/百万 = ¥94,608
输入总收入 = ¥96,500
总账:
| 项目 | 金额 |
|---|---|
| 总收入 | ¥222,644 |
| 显卡成本 | -¥250,000 |
| 净盈亏 | -¥27,356(亏) |
一张 H800 单打独斗跑 4 年,亏两万七。
这个结果其实不意外——DeepSeek 说的「电费级定价」在单卡场景下是字面意思:收入确实只够付电费,连卡钱都回不了本。
四、第二笔账:两千张卡的集群
现在换一个场景:你的机房里有两千张 H800,每天有几百万用户在调用。
规模效应带来了几个质变:
- 高并发填满 GPU——请求永远在排队,GPU 利用率从 50% 拉到 85%
- 连续批处理——batch size 翻了好几倍,吞吐量大幅提升
- 缓存命中率飙升——热门 prompt 在集群中被反复命中,缓存命中率从 50% 升到 80%
- PagedAttention 等优化技术——显存利用率从 40% 提升到 90%+
这些不是理论推测。DeepSeek 在 2025 年开源周公布了实测数据:
单 H800 节点输出吞吐 14,800 tokens/秒(8 卡 DGX 节点,折合单卡约 1,850 tokens/秒)。输入吞吐 73,700 tokens/秒(折合单卡约 9,200 tokens/秒)。
| 指标 | 孤立单卡 | 集群规模化 |
|---|---|---|
| 输出吞吐 | 500 t/s | 1,850 t/s |
| GPU 利用率 | 50% | 85% |
| 缓存命中率 | 50% | 80% |
| 有效吞吐倍率 | 1x | ~4x |
4 年总计算量(每张卡):
输出 = 1,850 × 0.85 × 35,040h × 3,600s = 198,468,000,000 tokens
输入 = 9,200 × 0.85 × 35,040h × 3,600s = 986,861,000,000 tokens
收入:
输出收入 = 198,468 × 2 元/百万 = ¥396,936
缓存命中输入 = 789,489 × 0.02 元/百万 = ¥15,790
缓存未命中输入 = 197,372 × 1 元/百万 = ¥197,372
输入总收入 = ¥213,162
但 GPU 不能单独工作——它需要插在服务器里,接上网卡,吹着空调。这些基础设施成本也要算进去。
| 成本项(4 年摊薄) | 金额 |
|---|---|
| 显卡 | ¥250,000 |
| 服务器分摊(8 卡节点 ÷ 8) | ¥75,000 |
| InfiniBand 网络 | ¥30,000 |
| 电费(500W × ¥0.8/kWh) | ¥14,000 |
| 散热 | ¥10,000 |
| 机房机位 | ¥20,000 |
| 总成本 | ¥399,000 |
最终总账:
| 项目 | 孤立单卡 | 集群规模化 |
|---|---|---|
| 总收入 | ¥222,644 | ¥610,098 |
| 总成本 | ¥250,000 | ¥399,000 |
| 净盈亏 | -¥27,000(亏) | +¥211,000(赚) |
| ROI | -11% | +53% |
| 年化回报 | 亏 | ~11%/年 |
五、这张账告诉我们什么
1. 规模不是锦上添花,是生存门槛
单卡亏 2.7 万,集群单卡赚 21 万——相差近 24 万。这个差值就是规模效应的实际货币化。
对买了几百张卡的中小公司来说,他们的 GPU 利用率可能不到 60%,batch size 上不去,缓存命不中——实际上是在孤立单卡的区间运营,大概率亏钱。
对 DeepSeek、字节、阿里这种上万卡集群的大厂来说,把每张卡的吞吐推到 4 倍,就能在电费级定价下还能有 10%+ 的年化回报。
2. DeepSeek 定价策略的深层逻辑
「电费级定价」不是慈善,是一张准入门票。它定了一个其他玩家很难跟的价格。
小厂如果跟这个价——亏钱。 大厂如果跟这个价——赚少一点,但能活。
AI 价格战的本质不是价格战本身,是规模能力的分化。谁的 GPU 多、利用率高、吞吐优化做得好,谁才能在低价下盈利。
3. 一个有趣的推论
如果把 DeepSeek V3 的训练也按这个逻辑算:
| 场景 | 耗时 |
|---|---|
| 2,048 张 H800 训练 V3 | 55 天 |
| 1 张 H800 训练 V3 | 318 年 |
| 1 张 H800 推理到报废 | 4 年 |
同样的硬件,在它寿命内能推理的数据量是训练用数据量的 100 倍。
这就是为什么 GPU 厂商更愿意卖推理算力——推理是印钞机模式,训练是一锤子买卖。 训练再暴利也是一次性收入,但推理是按 token 持续收费的 annuity stream。
六、局限
这个计算做了几个简化假设:
- 定价稳定——假设 4 年内 DeepSeek V4 Flash 的定价不调整。现实是 AI 模型价格还在快速下降
- 利用率恒定——假设 4 年里的 GPU 利用率不变化。现实是需求波动很大
- 未计入人力成本——运营几千张卡的集群需要工程师团队,这笔开销不低
- 单模型假设——假设卡只跑一个模型。现实中集群通常混跑多个模型
这些假设都偏乐观——如果全部修正,实际利润会比 21 万更低。但结论的方向不变:规模化是把亏钱生意变成赚钱生意的必要条件。
附:数据来源
- DeepSeek 官方定价页:api-docs.deepseek.com
- DeepSeek 开源周(FlashMLA)实测吞吐数据
- 中关村在线、3DM 等关于数据中心 GPU 寿命的报道
- 机电之家等 H800 报价(2026 年 5 月)