文档
上手 CloudGPU 需要知道的都在这儿。
rocket_launch快速上手
api把实例当成 API 接口用
写给做 AI agent、聊天机器人,或者任何需要一个按小时固定收费、而不是按 token 计费的大模型后端的人。
每个跑着的 Ollama 实例都会给你一个兼容 OpenAI 的接口。在控制台里打开这个实例,点 API 按钮,把下面任意一段复制走:
OpenAI Python SDK
from openai import OpenAI
client = OpenAI(
base_url="https://deployment-xxxx-11434.550w.link/v1",
api_key="ollama", # any non-empty string
)
resp = client.chat.completions.create(
model="qwen2.5:0.5b",
messages=[{"role": "user", "content": "Hello"}],
)
print(resp.choices[0].message.content)
curl
curl https://deployment-xxxx-11434.550w.link/api/chat \
-H "Content-Type: application/json" \
-d '{
"model": "qwen2.5:0.5b",
"messages": [{ "role": "user", "content": "Hello" }],
"stream": false,
"keep_alive": "30m"
}'
提示:keep_alive
每次请求都带上 "keep_alive": "30m" ,让模型在最后一次调用之后还在显存里留 30 分钟。不带的话,Ollama 空闲 5 分钟就把模型卸掉,你下一次请求要多等 30 到 90 秒的冷加载。
memory该选哪张卡?
下面的价格都是按小时的零售价。供应商库存是实时的 —— 部署页里某张卡显示「无货」时,选最接近的更高一档。
| 模型大小 | 最低显存 | 推荐卡型 | 价格 |
|---|---|---|---|
| 0.5B – 8B(Qwen 2.5、Llama-3.1-8B、Mistral-7B) | 16 GB | RTX 4090 24 GB | $0.35/小时 |
| 13B – 32B 量化(Qwen-32B-AWQ、CodeLlama-34B) | 32 GB | RTX 5090 32 GB | $0.49/小时 |
| 30B 以上全精度,中等批量推理 | 48 GB | L40 / L40S 48 GB | $0.65 – $0.89/小时 |
| 70B 量化(Llama-3.3-70B-AWQ、Qwen3-72B-Int4) | 40 GB | A100 40G | $0.66/小时 |
| 70B 全精度,生产批量 | 80 GB | A800 80G | $1.18/小时 |
| 长上下文大模型 + 长链推理 | 96 GB | H20 96G | $1.35/小时 |
| 企业级推理 / 多 agent 生产环境 | 80 GB | H800 80G | $3.09/小时 |
也有多卡套餐(2 卡 / 4 卡 / 8 卡 4090),跑 70B 以上量化模型时价格很有竞争力 —— 实时列表见部署页。
help常见问题
现在有哪些卡可以用?expand_more
四家供应商的库存每小时都在变,唯一诚实的回答是看实时列表。部署页列出我们此刻能开的每一张卡,带显存、每小时价格和剩余数量;没货的会收起来。卡型从 RTX 3090 一直到 A100 80G。
怎么计费?expand_more
按 GPU 使用小时数计费,起步 1 小时。第一小时之后按秒计。实例启动时开始计费,销毁时停止。所有价格以美元标示。
最少要充多少?expand_more
No deposit required to start. $0.50 lands when you sign up and another $0.50 once you verify your email — $1.00 in all, enough for a couple of hours on an RTX 4090.
实例能停了再开吗?expand_more
你可以随时销毁实例。目前停掉的实例会把卡释放出去 —— 要继续用就得新开一台。跨重启的持久化存储在计划里。
实例里预装了什么?expand_more
现在每个模板都是一键起的无服务器容器(比如带 Qwen/Llama 的 Ollama、Stable Diffusion WebUI、Whisper)。容器里已经打包好模型权重,并在一个专属地址上暴露 HTTP 接口。可以 SSH 进 Ubuntu 的裸机租用在计划里。
有哪些地区?expand_more
CloudGPU 的控制面在香港。GPU 实例本身跑在供应商位于中国大陆的机房里(广东、河南、浙江、新疆等)。你那台实例具体在哪个地区,控制台里能看到。
有 API 吗?expand_more
有。每台实例都开着一个兼容 OpenAI 的 REST 接口(大模型模板),或者对应模型自己的 REST 接口(图像 / 音频模板)。在控制台里任意运行中的实例上点 API 按钮,就有可以直接复制的 curl、Python 和 Node 示例。
怎么找客服?expand_more
发邮件到 support@cloudgpu.app,或者去联系页。公测期间我们争取 24 小时内回复。
模板页和部署页有什么区别?expand_more
模板页是目录 —— 搜索、筛选所有能跑的东西,看哪些已就绪、哪些还没开放。部署页是真正开机的地方:选一个模板或者一张裸卡,选卡型,大约 60 秒后拿到地址。逛在模板页,开在部署页。
能部署自己的模型吗?expand_more
大模型方面,我们的 Ollama 模板支持 Ollama 库里的任何模型 —— 部署完点「选择模型」按钮,从 qwen2.5:0.5b 到 llama3.1:70b 想拉哪个拉哪个。非大模型的自定义模型,等裸卡租用开放。
怎么把部署好的模型接到我的应用上?expand_more
在控制台里打开运行中的实例,点 API 按钮。你会拿到一个 /v1/chat/completions 的 OpenAI 兼容地址,还有可以直接粘的 curl、Python(requests 和 OpenAI SDK)、Node.js 代码。接进 LangChain / AutoGen / CrewAI 只要一行。
还有别的问题?
联系客服