简单、透明的 价格
用多少付多少。没有隐藏费用,不收出网流量费,随时可以停。
最多便宜 60%
同型号 GPU,比 RunPod 便宜
多地机房
机器在亚太及更多地区。印度、东南亚、拉美和欧洲的开发者延迟都低。
60 秒开机
浏览器里就能用。不用 SSH,不用配环境。
| GPU 型号 | 库存 | CloudGPU | Vast.ai | RunPod |
|---|---|---|---|---|
| RTX 3090 24G由 P2P agent 供给 | 库存紧张 | $0.20/hr | $0.22/hr | $0.22/hr |
| RTX 4090 24G | 库存紧张 | $0.32/hr | $0.32/hr | $0.34/hr |
| RTX 4090D 48G国内特供 4090,48GB 显存 | 库存紧张 | $0.59/hr | N/A | N/A |
| 5090 32G | 库存紧张 | $0.49/hr | N/A | N/A |
| A100 40G | 库存紧张 | $0.89/hr | $0.80/hr | $1.89/hr |
| L20 48G国内特供 Ada 架构,大显存 | 库存紧张 | $0.89/hr | N/A | $1.20/hr |
| L40 48G | 库存紧张 | $0.79/hr | N/A | $1.19/hr |
| L40S 48G | 库存紧张 | $1.19/hr | $1.65/hr | $1.89/hr |
| H20 96G国内特供 Hopper 架构,超大 HBM3 | 库存紧张 | $1.59/hr | N/A | N/A |
| Ascend 910B 64GNPU —— 只支持 CANN / MindSpore / PyTorch-NPU | 库存紧张 | $0.85/hr | N/A | N/A |
| A800 80GChina-spec A100 | 库存紧张 | $1.39/hr | N/A | $2.17/hr |
| H800 80G国内特供 H100,NVLink 限速 400Gb/s | 库存紧张 | $3.49/hr | N/A | $3.99/hr |
Vast.ai / RunPod rates observed April 2026 for equivalent SKU. "N/A" = competitor does not offer that GPU in their catalog.
性能和适用场景
光看价格挑不出合适的卡。L20、H20 和昇腾 910B 是国内特供,美国云上买不到 —— 它们的显存和带宽组合很特别,值得单独比一比。
| GPU | 架构 | VRAM | FP16 TFLOPS | 带宽 | 适合做什么 |
|---|---|---|---|---|---|
RTX 3090 24G 由 P2P agent 供给 | Ampere | 24 GB | 36 | 936 GB/s | 7B 以内的大模型推理、Stable Diffusion、便宜的开发机 |
RTX 4090 24G | Ada | 24 GB | 73 | 1008 GB/s | 微调 7B–13B,Flux / SDXL,快速推理 |
RTX 4090D 48G 国内特供 4090,48GB 显存 | Ada | 48 GB | 73 | 1008 GB/s | 大批量微调 13B–30B,70B 量化推理 |
5090 32G | Blackwell | 32 GB | 104 | 1792 GB/s | 最新消费级旗舰 —— Blackwell 特性,跑 SD/Flux 很快 |
A100 40G | Ampere | 40 GB | 312 | 1555 GB/s | 大模型训练 / 微调 13B–30B,科研 |
L20 48G 国内特供 Ada 架构,大显存 | Ada | 48 GB | 119 | 864 GB/s | 32B 推理、多模型并行服务、吃显存的负载 |
L40 48G | Ada | 48 GB | 90 | 864 GB/s | 32B 推理,图形和计算混合负载 |
L40S 48G | Ada | 48 GB | 183 | 864 GB/s | 高端推理加轻量训练,比 L40 更强 |
H20 96G 国内特供 Hopper 架构,超大 HBM3 | Hopper | 96 GB | 148 | 4000 GB/s | 70B–120B 推理、长上下文、MoE 模型 |
Ascend 910B 64G NPU —— 只支持 CANN / MindSpore / PyTorch-NPU | Ascend | 64 GB | 320 | 1200 GB/s | 合规的国产化训练,MindSpore / PyTorch-NPU 负载 |
A800 80G China-spec A100 | Ampere | 80 GB | 312 | 2039 GB/s | FP32/FP16 训练 30B–70B,大显存科研 |
H800 80G 国内特供 H100,NVLink 限速 400Gb/s | Hopper | 80 GB | 989 | 3350 GB/s | 前沿训练、70B 以上微调、FP8 推理 |
显存决定能装多大的模型
24 GB 能跑 FP16 的 7B,或者量化后的 30B。48 GB 能跑 FP16 的 13B,或者量化后的 70B。96 GB 跑 FP16 的 70B 很宽裕。
Mem bandwidth = tokens/sec
大模型推理的吞吐跟显存带宽走,不是跟 TFLOPS 走。跑大模型时,H20 的 4 TB/s 比 A100 更强。
FP16 TFLOPS = training speed
微调时 A100 的 312 TFLOPS 很能打。910B 的 320 是标称值 —— 实际速度看 CANN / MindSpore 生态成熟到什么程度。
费用估算
1x
8h
7 days
套餐
没有隐藏费用 · 不收出网流量费 · 按小时计费 · 随时可停