Dokumentasi
Semua yang Anda perlukan untuk mulai memakai CloudGPU.
rocket_launchPanduan Cepat
Buat akun
Daftar di CloudGPU. $0.50 langsung masuk, $0.50 lagi setelah email diverifikasi.
Buat akun →Buka halaman Deploy
Buka halaman Deploy dan pilih model — DeepSeek, Qwen, Llama, atau Mistral.
Buka halaman Deploy →Klik Deploy
Pilih GPU, klik Deploy. Sisanya kami tangani — penyiapan GPU, unduh model, server API.
Salin endpoint API
Setelah ~60 detik, Anda mendapat URL API kompatibel OpenAI yang siap dipakai.
Tempel ke kode Anda
Setel base_url ke endpoint Anda. Selesai — token tanpa batas, biaya per jam tetap.
Tempel ke kode Anda →apiMemakai instance Anda sebagai endpoint API
Untuk pengembang yang membangun AI agent, chatbot, atau aplikasi apa pun yang butuh backend LLM dengan biaya per jam tetap, bukan penagihan per token.
Setiap instance Ollama yang berjalan memberi Anda endpoint kompatibel OpenAI. Buka instance itu di Dasbor lalu klik API tombolnya untuk menyalin salah satu dari ini:
OpenAI Python SDK
curl
Tips: keep_alive
Sertakan "keep_alive": "30m" di setiap permintaan agar model tetap di VRAM selama 30 menit setelah panggilan terakhir. Tanpa itu, Ollama melepas model setelah 5 menit menganggur dan permintaan berikutnya kena penalti cold-load 30–90 detik.
memoryGPU mana yang sebaiknya saya pilih?
Semua harga di bawah adalah harga ritel per jam. Ketersediaan pemasok bersifat langsung — jika sebuah kartu tampil "Stok habis" di halaman Deploy, pilih kelas terdekat di atasnya.
| Ukuran model | VRAM minimum | GPU yang disarankan | Harga |
|---|---|---|---|
| 0,5B – 8B (Qwen 2.5, Llama-3.1-8B, Mistral-7B) | 16 GB | RTX 4090 24 GB | $0,35/jam |
| 13B – 32B terkuantisasi (Qwen-32B-AWQ, CodeLlama-34B) | 32 GB | RTX 5090 32 GB | $0,49/jam |
| 30B+ presisi penuh, inferensi batch sedang | 48 GB | L40 / L40S 48 GB | $0,65 – $0,89/jam |
| 70B terkuantisasi (Llama-3.3-70B-AWQ, Qwen3-72B-Int4) | 40 GB | A100 40G | $0,66/jam |
| 70B presisi penuh, batch produksi | 80 GB | A800 80G | $1,18/jam |
| LLM konteks panjang + penalaran panjang | 96 GB | H20 96G | $1,35/jam |
| Inferensi enterprise / produksi multi-agent | 80 GB | H800 80G | $3,09/jam |
Paket multi-kartu (2× / 4× / 8× 4090) juga tersedia dan kompetitif untuk beban kerja 70B+ terkuantisasi — lihat halaman Deploy untuk daftar terkini.
helpPertanyaan yang Sering Diajukan
GPU apa saja yang tersedia sekarang?expand_more
Bagaimana cara penagihannya?expand_more
Berapa deposit minimumnya?expand_more
Bisakah instance saya dihentikan lalu dinyalakan lagi?expand_more
Apa saja yang sudah terpasang di instance?expand_more
Region mana saja yang tersedia?expand_more
Apakah ada API-nya?expand_more
Bagaimana cara mendapat dukungan?expand_more
Apa bedanya Templat dan Deploy?expand_more
Bisakah saya men-deploy model kustom?expand_more
Bagaimana menghubungkan model yang sudah di-deploy ke aplikasi saya?expand_more
Masih ada pertanyaan?
Hubungi dukungan