文档

上手 CloudGPU 需要知道的都在这儿。

rocket_launch快速上手

1

注册一个账号

在 CloudGPU 注册。当场到账 $0.50,验证邮箱再送 $0.50。

注册一个账号
2

打开部署页

打开部署页,挑一个模型 —— DeepSeek、Qwen、Llama 或者 Mistral。

打开部署页
3

点部署

选一张卡,点部署。剩下的我们来 —— 开机、下载模型、起 API 服务。

4

复制 API 地址

大约 60 秒后,你会拿到一个可以直接用的 OpenAI 兼容接口地址。

5

粘进你的代码

把 base_url 设成你的地址。就完事了 —— token 不限量,按小时固定收费。

粘进你的代码

api把实例当成 API 接口用

写给做 AI agent、聊天机器人,或者任何需要一个按小时固定收费、而不是按 token 计费的大模型后端的人。

每个跑着的 Ollama 实例都会给你一个兼容 OpenAI 的接口。在控制台里打开这个实例,点 API 按钮,把下面任意一段复制走:

OpenAI Python SDK

from openai import OpenAI client = OpenAI( base_url="https://deployment-xxxx-11434.550w.link/v1", api_key="ollama", # any non-empty string ) resp = client.chat.completions.create( model="qwen2.5:0.5b", messages=[{"role": "user", "content": "Hello"}], ) print(resp.choices[0].message.content)

curl

curl https://deployment-xxxx-11434.550w.link/api/chat \ -H "Content-Type: application/json" \ -d '{ "model": "qwen2.5:0.5b", "messages": [{ "role": "user", "content": "Hello" }], "stream": false, "keep_alive": "30m" }'

提示:keep_alive

每次请求都带上 "keep_alive": "30m" ,让模型在最后一次调用之后还在显存里留 30 分钟。不带的话,Ollama 空闲 5 分钟就把模型卸掉,你下一次请求要多等 30 到 90 秒的冷加载。

memory该选哪张卡?

下面的价格都是按小时的零售价。供应商库存是实时的 —— 部署页里某张卡显示「无货」时,选最接近的更高一档。

模型大小最低显存推荐卡型价格
0.5B – 8B(Qwen 2.5、Llama-3.1-8B、Mistral-7B)16 GBRTX 4090 24 GB$0.35/小时
13B – 32B 量化(Qwen-32B-AWQ、CodeLlama-34B)32 GBRTX 5090 32 GB$0.49/小时
30B 以上全精度,中等批量推理48 GBL40 / L40S 48 GB$0.65 – $0.89/小时
70B 量化(Llama-3.3-70B-AWQ、Qwen3-72B-Int4)40 GBA100 40G$0.66/小时
70B 全精度,生产批量80 GBA800 80G$1.18/小时
长上下文大模型 + 长链推理96 GBH20 96G$1.35/小时
企业级推理 / 多 agent 生产环境80 GBH800 80G$3.09/小时

也有多卡套餐(2 卡 / 4 卡 / 8 卡 4090),跑 70B 以上量化模型时价格很有竞争力 —— 实时列表见部署页。

help常见问题

现在有哪些卡可以用?expand_more
四家供应商的库存每小时都在变,唯一诚实的回答是看实时列表。部署页列出我们此刻能开的每一张卡,带显存、每小时价格和剩余数量;没货的会收起来。卡型从 RTX 3090 一直到 A100 80G。
怎么计费?expand_more
按 GPU 使用小时数计费,起步 1 小时。第一小时之后按秒计。实例启动时开始计费,销毁时停止。所有价格以美元标示。
最少要充多少?expand_more
No deposit required to start. $0.50 lands when you sign up and another $0.50 once you verify your email — $1.00 in all, enough for a couple of hours on an RTX 4090.
实例能停了再开吗?expand_more
你可以随时销毁实例。目前停掉的实例会把卡释放出去 —— 要继续用就得新开一台。跨重启的持久化存储在计划里。
实例里预装了什么?expand_more
现在每个模板都是一键起的无服务器容器(比如带 Qwen/Llama 的 Ollama、Stable Diffusion WebUI、Whisper)。容器里已经打包好模型权重,并在一个专属地址上暴露 HTTP 接口。可以 SSH 进 Ubuntu 的裸机租用在计划里。
有哪些地区?expand_more
CloudGPU 的控制面在香港。GPU 实例本身跑在供应商位于中国大陆的机房里(广东、河南、浙江、新疆等)。你那台实例具体在哪个地区,控制台里能看到。
有 API 吗?expand_more
有。每台实例都开着一个兼容 OpenAI 的 REST 接口(大模型模板),或者对应模型自己的 REST 接口(图像 / 音频模板)。在控制台里任意运行中的实例上点 API 按钮,就有可以直接复制的 curl、Python 和 Node 示例。
怎么找客服?expand_more
发邮件到 support@cloudgpu.app,或者去联系页。公测期间我们争取 24 小时内回复。
模板页和部署页有什么区别?expand_more
模板页是目录 —— 搜索、筛选所有能跑的东西,看哪些已就绪、哪些还没开放。部署页是真正开机的地方:选一个模板或者一张裸卡,选卡型,大约 60 秒后拿到地址。逛在模板页,开在部署页。
能部署自己的模型吗?expand_more
大模型方面,我们的 Ollama 模板支持 Ollama 库里的任何模型 —— 部署完点「选择模型」按钮,从 qwen2.5:0.5b 到 llama3.1:70b 想拉哪个拉哪个。非大模型的自定义模型,等裸卡租用开放。
怎么把部署好的模型接到我的应用上?expand_more
在控制台里打开运行中的实例,点 API 按钮。你会拿到一个 /v1/chat/completions 的 OpenAI 兼容地址,还有可以直接粘的 curl、Python(requests 和 OpenAI SDK)、Node.js 代码。接进 LangChain / AutoGen / CrewAI 只要一行。

还有别的问题?

联系客服