Pertanyaan yang Makin Sering Kami Terima
Dalam beberapa bulan terakhir, pertanyaan klien kami bergeser. Dulu: perlukah bisnis saya pakai AI? Sekarang: lebih hemat mana, menjalankan model bahasa (LLM) sendiri di server atau terus membayar API ke provider seperti OpenAI, Anthropic, atau Google?
Jawaban jujurnya: tergantung volume, jenis data, dan kesiapan tim Anda. Artikel ini tidak akan menjual salah satu opsi. Kami akan membedah komponen biayanya satu per satu, menghitung titik impas dengan rumus yang bisa Anda pakai sendiri, lalu menunjukkan pola hybrid yang paling sering kami rekomendasikan untuk UMKM dan bisnis menengah.
Catatan: semua angka harga di artikel ini adalah angka ilustrasi untuk memudahkan hitungan. Harga GPU, API, dan kurs berubah cepat, jadi selalu cek harga terbaru sebelum mengambil keputusan.
Komponen Biaya Sebenarnya
Biaya API: Bayar per Token
Dengan API, Anda membayar per token (potongan kata) yang masuk dan keluar dari model. Tidak ada server GPU yang perlu diurus, tetapi tagihan tumbuh linear seiring pemakaian. Dokumentasi komunitas OpenClaw, agen AI open-source yang bisa terhubung ke berbagai provider, memberi gambaran nyata: pemakaian ringan bisa menelan sekitar USD 30–150 per bulan, pemakaian sedang USD 150–600, dan pemakaian berat bisa melewati USD 1.500 per bulan. Sumber biaya terbesar justru tugas otomatis yang berjalan terus-menerus di latar belakang, bukan chat manual.
Biaya Self-Host: GPU, VPS, Listrik, dan Bandwidth
Self-host berarti Anda menjalankan model open-weight (misalnya Qwen atau Llama) di server sendiri menggunakan runtime seperti Ollama, vLLM, atau SGLang. Model bisa gratis, tetapi hardware tidak. Panduan yang sama memetakan kebutuhan VRAM secara kasar: 8 GB untuk model 8B (tugas dasar), 16 GB untuk 14B, 24 GB kelas RTX 4090 untuk 32B, dan 40–80 GB kelas A100 untuk model 70B yang kualitasnya mendekati layanan cloud.
Komponen biaya self-host biasanya terdiri dari:
| Komponen | Cloud GPU / GPU VPS | Server Sendiri (On-Premise) |
|---|---|---|
| Hardware | Sewa per jam/bulan, tanpa modal awal | Beli di muka (capex), depresiasi 3–4 tahun |
| Listrik | Sudah termasuk harga sewa | Rp1.400–1.700/kWh tergantung golongan PLN, plus pendingin |
| Bandwidth | Biasanya termasuk kuota, egress bisa berbayar | Butuh koneksi dedicated dan IP publik yang stabil |
| Server aplikasi | VPS terpisah untuk backend | Bisa digabung, tapi berisiko |
| Tenaga kerja | Setup, update, monitoring | Sama, ditambah perawatan fisik |
Contoh kasar listrik on-premise: satu mesin dengan GPU kelas 4090 menarik sekitar 0,6 kW saat bekerja. Jika menyala 24/7, itu sekitar 430 kWh per bulan atau kurang lebih Rp600–730 ribu, belum termasuk AC ruangan server.
Untuk sisi aplikasi (backend, database, gateway), cloud VPS tetap jadi fondasi yang masuk akal. ScalaHosting mencatat bahwa cloud VPS memberi resource terdedikasi yang tidak terganggu pengguna lain dan bisa di-scale dalam hitungan detik, dengan paket yang solid umumnya mulai sekitar USD 20 per bulan.
Titik Impas: Kapan Self-Host Mulai Lebih Murah?
Rumus sederhananya:
Volume impas (token/bulan) = (Biaya infrastruktur + Biaya operasional) ÷ Harga API per token
Misalkan satu GPU cloud kelas data center menyala 24/7 dengan biaya sekitar USD 1.100 per bulan, ditambah biaya operasional (sebagian waktu engineer untuk update dan monitoring) sekitar USD 700. Total USD 1.800 per bulan.
| Harga API pembanding (per 1 juta token, blended) | Volume impas per bulan | Catatan |
|---|---|---|
| USD 0,50 (model ringan) | 3,6 miliar token | Kemungkinan melebihi kapasitas satu GPU, API hampir selalu menang |
| USD 3 (model menengah) | 600 juta token | Realistis untuk bisnis dengan chatbot CS bervolume tinggi |
| USD 10 (model premium) | 180 juta token | Tapi kualitas model open-weight belum tentu setara |
Sebagai gambaran volume: satu percakapan customer service rata-rata bisa memakan sekitar 2.000 token. Sepuluh ribu percakapan per hari berarti sekitar 600 juta token per bulan, tepat di titik impas skenario menengah.
Ada jebakan penting di sini: bandingkan apel dengan apel. Model 32B yang Anda jalankan sendiri seharusnya dibandingkan dengan API model sekelas, bukan dengan model frontier termahal. Banyak provider kini menjual akses model open-weight dengan harga per token yang sangat rendah, dan pada titik itu self-host murni jarang menang dari sisi biaya.
Alasan Non-Biaya: UU PDP, Data Sensitif, dan Kontrol Model
Sering kali keputusan self-host bukan soal hemat, melainkan soal kepatuhan dan kontrol.
UU Pelindungan Data Pribadi (UU No. 27 Tahun 2022). Undang-undang ini mengatur transfer data pribadi ke luar wilayah Indonesia, yang pada prinsipnya mensyaratkan negara tujuan memiliki tingkat pelindungan setara atau lebih tinggi, atau adanya pelindungan yang memadai dan mengikat, atau persetujuan subjek data. Saat Anda mengirim data pelanggan ke API yang servernya di luar negeri, secara praktis Anda sedang melakukan transfer lintas batas. Ini bukan berarti API dilarang, tetapi Anda perlu dasar hukum, perjanjian pemrosesan data, dan dokumentasi yang rapi. Konsultasikan detailnya dengan konsultan hukum Anda.
Data sensitif. Rekam medis, data keuangan, dokumen hukum, atau rahasia dagang adalah kandidat kuat untuk diproses di infrastruktur sendiri. Dokumentasi OpenClaw menyebut privasi sebagai salah satu alasan utama arsitektur local-first: dengan model lokal, data tidak perlu keluar dari mesin Anda.
Kontrol penuh atas model. Provider API bisa mengubah perilaku model, mempensiunkan versi lama, atau menaikkan harga. Dengan self-host, Anda mengunci versi model, bisa melakukan fine-tuning, dan tidak bergantung pada kebijakan pihak ketiga.
Beban Tersembunyi Self-Host
Inilah bagian yang paling sering diremehkan di spreadsheet perencanaan.
- Update dan patch keamanan. Ekosistem AI open-source bergerak sangat cepat. Sebagai contoh, dokumentasi komunitas OpenClaw mencatat 10 CVE dalam enam bulan, termasuk celah eksekusi kode jarak jauh yang kritis, serta lebih dari 40.000 gateway yang ditemukan terbuka di internet tanpa pengamanan memadai. Pelajarannya berlaku umum: siapa pun yang self-host wajib rutin memperbarui, membatasi port, dan mengaktifkan autentikasi.
- Monitoring. Anda perlu memantau utilisasi GPU, latensi, antrean request, dan error. Dokumentasi resmi OpenClaw bahkan menyediakan perintah khusus seperti pengecekan status gateway, doctor, dan triage, karena operasional harian memang butuh alat diagnosis.
- Perencanaan kapasitas. Trafik tidak rata. Jika puncak jam kerja butuh tiga kali lipat kapasitas rata-rata, GPU Anda menganggur di malam hari tetapi tetap ditagih.
- On-call. Saat server model mati pukul dua pagi dan chatbot pelanggan ikut mati, siapa yang bangun? Dengan API, itu urusan provider.
- Siklus model. Model open-weight baru rilis setiap beberapa bulan. Setiap upgrade berarti evaluasi ulang kualitas, uji regresi, dan kemungkinan kebutuhan VRAM berbeda.
Analogi dari dunia hosting cocok di sini. ScalaHosting menjelaskan bahwa VPS unmanaged memberi kebebasan penuh sekaligus tanggung jawab penuh saat ada yang rusak, sedangkan VPS managed menyerahkan urusan teknis ke provider. Self-host LLM adalah versi unmanaged dari AI.
Pola Hybrid yang Paling Sering Kami Rekomendasikan
Untuk sebagian besar UMKM dan bisnis menengah, jawaban terbaik bukan salah satu, melainkan kombinasi keduanya.
| Lapisan | Fungsi | Dijalankan di |
|---|---|---|
| Gateway / router model | Mengatur rute request, failover, pencatatan pemakaian token | Cloud VPS milik Anda |
| Model lokal kecil (8B–14B) | Masking data pribadi, klasifikasi, ringkasan internal, tugas rutin | GPU VPS atau server lokal |
| API model frontier | Penalaran kompleks, konten publik, tugas berkualitas tinggi | Provider API |
Prinsip kerjanya:
- Data sensitif tidak keluar. Model lokal menyamarkan nama, NIK, nomor telepon, dan data pribadi lain sebelum request diteruskan ke API.
- Tugas rutin ke model murah. Dokumentasi OpenClaw mencatat satu kasus di mana biaya turun dari USD 1.200 menjadi USD 36 per bulan hanya dengan routing model, yaitu mengarahkan tugas ringan ke model yang lebih murah atau lokal.
- Failover dua arah. Jika API gangguan, tugas penting bisa jatuh ke model lokal; jika server lokal down, sebagian tugas bisa dialihkan ke API.
- Evaluasi per kuartal. Pantau volume token bulanan. Begitu mendekati titik impas, pindahkan beban yang paling besar dan paling stabil ke self-host.
Untuk UMKM, mulailah dari API plus gateway di cloud VPS kecil, dan tambahkan model lokal hanya saat ada kebutuhan data sensitif. Untuk bisnis menengah dengan volume ratusan juta token per bulan, satu node GPU untuk tugas rutin ditambah API untuk tugas berat biasanya memberi keseimbangan terbaik antara biaya, kepatuhan, dan beban tim.
Penutup
Self-host LLM bukan otomatis lebih murah, dan API bukan otomatis lebih mudah dalam jangka panjang. Hitung volume token Anda, bandingkan dengan model sekelas, masukkan biaya tenaga kerja ke rumus, lalu pertimbangkan kewajiban UU PDP. Bagi kebanyakan bisnis Indonesia saat ini, pola hybrid memberi fleksibilitas untuk mulai hemat tanpa mengorbankan keamanan data. Jika Anda butuh bantuan menyiapkan cloud VPS, gateway model, atau GPU server, tim katili.dev siap membantu merancangnya sesuai skala bisnis Anda.