Dokumentasi

Semua yang Anda perlukan untuk mulai memakai CloudGPU.

rocket_launchPanduan Cepat

1

Buat akun

Daftar di CloudGPU. $0.50 langsung masuk, $0.50 lagi setelah email diverifikasi.

Buat akun
2

Buka halaman Deploy

Buka halaman Deploy dan pilih model — DeepSeek, Qwen, Llama, atau Mistral.

Buka halaman Deploy
3

Klik Deploy

Pilih GPU, klik Deploy. Sisanya kami tangani — penyiapan GPU, unduh model, server API.

4

Salin endpoint API

Setelah ~60 detik, Anda mendapat URL API kompatibel OpenAI yang siap dipakai.

5

Tempel ke kode Anda

Setel base_url ke endpoint Anda. Selesai — token tanpa batas, biaya per jam tetap.

Tempel ke kode Anda

apiMemakai instance Anda sebagai endpoint API

Untuk pengembang yang membangun AI agent, chatbot, atau aplikasi apa pun yang butuh backend LLM dengan biaya per jam tetap, bukan penagihan per token.

Setiap instance Ollama yang berjalan memberi Anda endpoint kompatibel OpenAI. Buka instance itu di Dasbor lalu klik API tombolnya untuk menyalin salah satu dari ini:

OpenAI Python SDK

from openai import OpenAI client = OpenAI( base_url="https://deployment-xxxx-11434.550w.link/v1", api_key="ollama", # any non-empty string ) resp = client.chat.completions.create( model="qwen2.5:0.5b", messages=[{"role": "user", "content": "Hello"}], ) print(resp.choices[0].message.content)

curl

curl https://deployment-xxxx-11434.550w.link/api/chat \ -H "Content-Type: application/json" \ -d '{ "model": "qwen2.5:0.5b", "messages": [{ "role": "user", "content": "Hello" }], "stream": false, "keep_alive": "30m" }'

Tips: keep_alive

Sertakan "keep_alive": "30m" di setiap permintaan agar model tetap di VRAM selama 30 menit setelah panggilan terakhir. Tanpa itu, Ollama melepas model setelah 5 menit menganggur dan permintaan berikutnya kena penalti cold-load 30–90 detik.

memoryGPU mana yang sebaiknya saya pilih?

Semua harga di bawah adalah harga ritel per jam. Ketersediaan pemasok bersifat langsung — jika sebuah kartu tampil "Stok habis" di halaman Deploy, pilih kelas terdekat di atasnya.

Ukuran modelVRAM minimumGPU yang disarankanHarga
0,5B – 8B (Qwen 2.5, Llama-3.1-8B, Mistral-7B)16 GBRTX 4090 24 GB$0,35/jam
13B – 32B terkuantisasi (Qwen-32B-AWQ, CodeLlama-34B)32 GBRTX 5090 32 GB$0,49/jam
30B+ presisi penuh, inferensi batch sedang48 GBL40 / L40S 48 GB$0,65 – $0,89/jam
70B terkuantisasi (Llama-3.3-70B-AWQ, Qwen3-72B-Int4)40 GBA100 40G$0,66/jam
70B presisi penuh, batch produksi80 GBA800 80G$1,18/jam
LLM konteks panjang + penalaran panjang96 GBH20 96G$1,35/jam
Inferensi enterprise / produksi multi-agent80 GBH800 80G$3,09/jam

Paket multi-kartu (2× / 4× / 8× 4090) juga tersedia dan kompetitif untuk beban kerja 70B+ terkuantisasi — lihat halaman Deploy untuk daftar terkini.

helpPertanyaan yang Sering Diajukan

GPU apa saja yang tersedia sekarang?expand_more
Stok berubah tiap jam di empat pemasok, jadi jawaban paling jujur adalah daftar langsung. Halaman Deploy menampilkan setiap kartu yang bisa kami nyalakan sekarang, lengkap dengan VRAM, harga per jam, dan sisa unitnya; kartu yang habis disembunyikan. Kartunya mulai dari RTX 3090 hingga A100 80G.
Bagaimana cara penagihannya?expand_more
Anda ditagih per jam pemakaian GPU dengan minimum 1 jam. Setelah jam pertama, pemakaian tambahan ditagih per 1 detik. Penagihan dimulai saat instance menyala dan berhenti saat Anda menghancurkannya. Semua harga dalam USD.
Berapa deposit minimumnya?expand_more
No deposit required to start. $0.50 lands when you sign up and another $0.50 once you verify your email — $1.00 in all, enough for a couple of hours on an RTX 4090.
Bisakah instance saya dihentikan lalu dinyalakan lagi?expand_more
Anda bisa menghancurkan instance kapan saja. Saat ini instance yang berhenti melepaskan GPU-nya — Anda perlu membuat instance baru untuk melanjutkan. Penyimpanan permanen lintas restart ada dalam rencana.
Apa saja yang sudah terpasang di instance?expand_more
Saat ini setiap templat adalah kontainer serverless sekali klik (mis. Ollama dengan Qwen/Llama, Stable Diffusion WebUI, Whisper). Kontainernya sudah dibangun lengkap dengan bobot model dan API HTTP di URL khusus. Sewa mentah dengan SSH ke Ubuntu ada dalam rencana.
Region mana saja yang tersedia?expand_more
Control plane CloudGPU berjalan di Hong Kong. Instance GPU-nya sendiri berjalan di pusat data pemasok kami di Tiongkok daratan (Guangdong, Henan, Zhejiang, Xinjiang, dan lainnya). Region spesifik instance Anda terlihat di dasbor.
Apakah ada API-nya?expand_more
Ada. Setiap instance membuka REST API kompatibel OpenAI (untuk templat LLM) atau REST API khusus model (untuk templat gambar/audio). Klik tombol API pada instance yang berjalan di dasbor untuk contoh curl, Python, dan Node yang siap disalin.
Bagaimana cara mendapat dukungan?expand_more
Kirim email ke support@cloudgpu.app atau kunjungi halaman Kontak kami. Selama masa beta kami berupaya membalas dalam 24 jam.
Apa bedanya Templat dan Deploy?expand_more
Templat adalah katalognya — cari dan saring semua yang bisa dijalankan, lihat mana yang siap dan mana yang belum. Deploy adalah tempat Anda benar-benar menyalakannya: pilih templat atau GPU polos, pilih kartunya, dan Anda dapat URL dalam sekitar 60 detik. Telusuri di Templat, nyalakan di Deploy.
Bisakah saya men-deploy model kustom?expand_more
Untuk LLM, templat Ollama kami mendukung model apa pun di pustaka Ollama — setelah deploy, pakai tombol "Pilih Model" untuk menarik apa saja dari qwen2.5:0.5b sampai llama3.1:70b. Untuk model kustom non-LLM, sewa GPU mentah segera hadir.
Bagaimana menghubungkan model yang sudah di-deploy ke aplikasi saya?expand_more
Buka instance Anda yang berjalan di dasbor lalu klik tombol API. Anda akan mendapat endpoint kompatibel OpenAI di /v1/chat/completions plus kode siap tempel untuk curl, Python (requests + OpenAI SDK), dan Node.js. Masukkan ke LangChain / AutoGen / CrewAI cukup satu baris.

Masih ada pertanyaan?

Hubungi dukungan