
Memilih perangkat untuk menjalankan large language model atau LLM secara lokal tidak cukup hanya dengan mencari angka TOPS paling tinggi. Ada dua pertanyaan yang lebih penting: apakah modelnya muat di memori dan seberapa cepat memori tersebut dapat memberi data kepada prosesor AI.
Itulah sebabnya RTX 5090 belum tentu menjadi pilihan terbaik untuk semua pengguna. GPU ini sangat cepat, tetapi VRAM-nya 32GB. Sebaliknya, komputer Ryzen AI Max+ 395 dan NVIDIA DGX Spark memiliki memori terpadu 128GB, sehingga dapat memuat model yang jauh lebih besar meskipun bandwidth-nya lebih rendah. H200 dan GB300 menggabungkan kapasitas besar dengan bandwidth kelas data center—dengan harga yang juga berbeda kelas.
Artikel ini berfokus pada inference LLM lokal, bukan sekadar gaming atau training model dari nol. Estimasi harga menggunakan patokan pasar per September 2026 dan dapat berubah mengikuti kurs, stok, pajak, garansi, konfigurasi SSD, serta biaya impor.
Jawaban Singkat
| Perangkat | Memori untuk AI | Bandwidth | Daya kelas | Kisaran harga* | Paling cocok untuk |
|---|---|---|---|---|---|
| Ryzen AI Max+ 395 | Hingga 128GB LPDDR5X terpadu | 256GB/s | 45–120W | Rp30–60 juta per sistem | Model besar dengan anggaran dan daya lebih rendah |
| NVIDIA DGX Spark | 128GB LPDDR5X terpadu | 273GB/s | PSU 240W | Rp80–105 juta landed/import | Developer yang perlu CUDA dan memori besar |
| GeForce RTX 5090 | 32GB GDDR7 | Sekitar 1,79TB/s | 575W GPU | Rp40–65 juta untuk GPU; Rp100–170 juta untuk PC lengkap | Model yang muat di 32GB dan harus berjalan cepat |
| NVIDIA H200 SXM | 141GB HBM3e | 4,8TB/s | Hingga 700W per GPU | Rp520–820 juta per modul; server jauh lebih mahal | Inference dan HPC data center |
| Workstation GB300, seperti GIGABYTE W775 | 252GB HBM3e GPU + 496GB LPDDR5X CPU | 7,1TB/s HBM | PSU 1.600W | Sekitar Rp1,8–2,5 miliar per sistem | Model raksasa dan enterprise on-premises |
*Harga bersifat indikatif, bukan quotation penjualan. H200 SXM memerlukan platform server khusus dan tidak dapat dipasang seperti VGA desktop biasa.
Kesimpulan sederhananya:
- Ryzen AI Max+ 395: kapasitas besar dengan biaya paling rasional.
- DGX Spark: kapasitas besar dengan ekosistem NVIDIA.
- RTX 5090: sangat cepat selama model muat dalam 32GB.
- H200: besar sekaligus sangat cepat, tetapi harus masuk infrastruktur data center.
- GB300: pilihan ekstrem ketika satu workstation harus menangani model yang tidak muat pada perangkat lain.
Mengapa Kapasitas Memori Sangat Penting?
Bobot model harus ditempatkan di RAM, unified memory, atau VRAM sebelum inference dapat berjalan. Sebagai hitungan dasar, model membutuhkan sekitar 2 byte per parameter pada FP16, 1 byte pada FP8, atau 0,5 byte pada kuantisasi 4-bit. Runtime, metadata kuantisasi, KV cache, context length, dan batch masih menambah kebutuhan memori.
| Ukuran model | Bobot FP16 | Bobot FP8 | Bobot 4-bit sebelum overhead |
|---|---|---|---|
| 8B | 16GB | 8GB | 4GB |
| 32B | 64GB | 32GB | 16GB |
| 70B | 140GB | 70GB | 35GB |
| 120B | 240GB | 120GB | 60GB |
| 405B | 810GB | 405GB | Sekitar 203GB |
Karena itu, model 70B 4-bit dengan bobot dasar sekitar 35GB umumnya tidak muat penuh di RTX 5090 32GB setelah overhead diperhitungkan. Sistem unified memory 128GB masih mempunyai ruang, tetapi tidak secepat GPU dengan memori berbandwidth tinggi. Kapasitas menentukan apakah model dapat berjalan; bandwidth sangat memengaruhi kecepatannya.
1. Ryzen AI Max+ 395: Kapasitas Besar dengan Harga Paling Masuk Akal
AMD Ryzen AI Max+ 395 menggabungkan CPU Zen 5 16-core, Radeon 8060S 40 Compute Units, NPU hingga 50 TOPS, dan dukungan LPDDR5X hingga 128GB. Spesifikasi resmi AMD mencantumkan antarmuka 256-bit dengan bandwidth 256GB/s.
Kelebihan utamanya adalah jumlah memori yang dapat dipakai GPU terintegrasi. Pada sistem 128GB, AMD menyebut hingga 96GB dapat dialokasikan sebagai variable graphics memory. Ini membuat model 70B terkuantisasi dan beberapa model Mixture-of-Experts besar dapat dijalankan tanpa GPU data center.
Kisaran harga Ryzen AI Max+ 395
Ryzen AI Max+ 395 bukan prosesor socket AM5 yang dibeli terpisah. Produk ini hadir sebagai mini PC, desktop terintegrasi, atau laptop. Sistem 128GB berada sekitar US$1.700–US$3.600, tergantung merek dan SSD. Setelah kurs, pajak, dan impor, patokan Indonesia yang masuk akal adalah Rp30–60 juta.
Kelebihan:
- Memori besar dengan biaya lebih rendah daripada solusi NVIDIA sekelas.
- Arsitektur x86 nyaman untuk komputer kerja sehari-hari.
- Hemat daya dan tersedia dalam bentuk ringkas.
- Menarik untuk llama.cpp, LM Studio, RAG, dan inference privat.
Kekurangan:
- Bandwidth 256GB/s jauh di bawah GPU desktop kelas atas.
- Dukungan software AI AMD belum selalu semulus CUDA.
- Memori biasanya tersolder dan tidak dapat di-upgrade.
- Tidak seluruh 128GB otomatis tersedia sebagai VRAM.
Pilih Ryzen AI Max+ 395 jika prioritas Anda adalah membuat model besar muat dengan biaya dan listrik yang masih masuk akal.
2. NVIDIA DGX Spark: Unified Memory Besar dengan CUDA
DGX Spark memakai GB10 Grace Blackwell Superchip, CPU Arm 20-core, dan GPU Blackwell. Perangkat ini memiliki 128GB coherent unified memory, bandwidth 273GB/s, serta performa AI hingga 1 PFLOP FP4. NVIDIA menyebut DGX Spark dapat dipakai untuk pengembangan model hingga 200 miliar parameter, bergantung pada presisi dan workload.
Secara konsep, DGX Spark mirip Ryzen AI Max: kapasitas besar, tetapi bandwidth tidak mendekati kartu HBM. Pembeda utamanya adalah CUDA, Tensor Cores, ConnectX networking, dan software stack NVIDIA yang sudah disiapkan.
Kisaran harga DGX Spark
NVIDIA menaikkan MSRP Founders Edition dari US$3.999 menjadi US$4.699 pada Februari 2026. Nilainya sekitar Rp77 juta jika hanya dikonversi dengan kurs Rp16.400 per dolar AS. Setelah pajak, impor, dan margin, kisaran realistis di Indonesia adalah Rp80–105 juta. Varian OEM dapat berbeda.
Kelebihan:
- Unified memory 128GB dengan CUDA dalam perangkat ringkas.
- Framework, container, dokumentasi, dan ekosistem AI NVIDIA matang.
- Storage 4TB dan jaringan ConnectX-7 sudah terintegrasi.
Kekurangan:
- Bandwidth 273GB/s hanya sedikit di atas Ryzen AI Max.
- CPU Arm dapat terkendala software yang hanya menyediakan binary x86.
- Harga jauh lebih tinggi daripada sebagian sistem AMD 128GB.
Pilih DGX Spark jika kenyamanan CUDA lebih penting daripada performa per rupiah.
3. RTX 5090: Sangat Cepat, tetapi VRAM 32GB
GeForce RTX 5090 mempunyai 32GB GDDR7, antarmuka 512-bit, bandwidth sekitar 1,79TB/s, dan 21.760 CUDA cores. Harga referensi NVIDIA adalah US$1.999, tetapi kartu partner dan stok retail dapat membuat harganya lebih tinggi.
Bandwidth RTX 5090 sekitar tujuh kali Ryzen AI Max dan 6,5 kali DGX Spark. Jika seluruh model dan KV cache muat dalam VRAM, RTX 5090 menjadi pilihan sangat menarik untuk inference cepat, image generation, fine-tuning ringan, dan workstation serbaguna.
Saat model tidak muat, offload ke RAM memang memungkinkan, tetapi transfer melalui PCIe mengurangi keunggulan kecepatannya. Dua RTX 5090 juga tidak otomatis menjadi satu pool VRAM 64GB; software harus membagi model antar-GPU, dan kartu ini tidak memiliki NVLink.
Kisaran harga RTX 5090
- GPU saja: sekitar Rp40–65 juta, tergantung merek, cooler, stok, dan garansi.
- PC lengkap dengan RAM 64–128GB, SSD, casing, pendingin, serta PSU berkualitas: sekitar Rp100–170 juta.
Kelebihan:
- Sangat cepat untuk model yang muat dalam 32GB.
- Ekosistem CUDA luas.
- Bisa dipakai untuk gaming, rendering, editing, dan AI.
- Komponen PC lain tetap fleksibel untuk di-upgrade.
Kekurangan:
- VRAM 32GB menjadi batas untuk model 70B dan konteks panjang.
- Konsumsi daya sekitar 575W menuntut PSU dan airflow serius.
- Multi-GPU menambah biaya dan kompleksitas tanpa unified memory otomatis.
Pilih RTX 5090 jika mayoritas model Anda muat dalam 32GB dan kecepatan lebih penting daripada kapasitas maksimum.
4. NVIDIA H200: Besar dan Cepat, tetapi Bukan GPU Desktop
NVIDIA H200 SXM menawarkan 141GB HBM3e dengan bandwidth 4,8TB/s. Dokumentasi NVIDIA menempatkannya sebagai akselerator platform HGX, bukan pengganti langsung kartu GeForce.
Kapasitasnya memberi ruang besar untuk model terkuantisasi, KV cache, dan batching. Bandwidth H200 hampir 19 kali Ryzen AI Max dan sekitar 2,7 kali RTX 5090. Namun modul SXM memerlukan baseboard, CPU host, NVLink atau NVSwitch, pendinginan, PSU, chassis, dan firmware server yang sesuai.
Kisaran harga H200
Harga pasar indikatif H200 SXM baru berada di sekitar US$32.000–US$50.000 per modul, atau kurang lebih Rp520–820 juta sebelum platform server. Server lengkap dengan beberapa H200 dapat bernilai beberapa miliar rupiah. Untuk pekerjaan sesekali, menyewa H200 di cloud sering lebih rasional.
Kelebihan:
- Memori 141GB HBM3e: besar sekaligus sangat cepat.
- Cocok untuk throughput tinggi, long context, batching, HPC, dan training.
- Mendukung ECC, MIG, NVLink, dan fitur data center.
Kekurangan:
- Tidak dapat dipasang ke PC biasa.
- Biaya server, jaringan, listrik, pendinginan, dan support sangat tinggi.
- Kurang masuk akal untuk pengguna pribadi dengan utilisasi rendah.
Pilih H200 jika workload sudah berada di kelas server dan utilisasi tinggi dapat membayar investasinya.
5. GB300: Workstation untuk Model Raksasa
GB300 dalam perbandingan ini merujuk pada workstation NVIDIA GB300 Grace Blackwell Ultra Desktop Superchip, seperti GIGABYTE W775-V10-L01. Sistem tersebut menggabungkan GPU Blackwell Ultra dengan 252GB HBM3e dan CPU Grace 72-core dengan 496GB LPDDR5X ECC.
Spesifikasi resmi GIGABYTE W775 mencantumkan bandwidth HBM 7,1TB/s, bandwidth memori CPU hingga 396GB/s, dan total coherent memory 748GB. Kapasitas ini membuka kemungkinan menjalankan model 405B terkuantisasi di HBM atau model lebih besar dengan coherent CPU memory. Hasil praktis tetap bergantung pada quantization, context length, KV cache, dan engine inference.
Kisaran harga GB300 workstation
Harga biasanya diberikan melalui quotation. Salah satu konfigurasi retail internasional GIGABYTE W775 tercantum US$128.849, atau sekitar Rp2,1 miliar sebelum penyesuaian lokal. Anggaran indikatif Indonesia adalah Rp1,8–2,5 miliar, tergantung storage, garansi, integrator, kurs, dan dukungan.
Kelebihan:
- 252GB HBM3e dan total coherent memory hingga 748GB.
- Bandwidth HBM 7,1TB/s.
- Bentuk tower lebih praktis daripada rack server multi-GPU.
- Jaringan 2×400Gb/s untuk infrastruktur berperforma tinggi.
Kekurangan:
- Harga masuk kelas investasi perusahaan.
- PSU 1.600W, liquid cooling, jaringan, dan kondisi ruangan harus diperhitungkan.
- CPU Grace memakai arsitektur Arm, sehingga kompatibilitas software perlu diaudit.
Pilih GB300 jika organisasi membutuhkan satu sistem on-premises berkapasitas sangat besar tanpa langsung membangun klaster rack-scale.
Perbandingan Kapasitas Model secara Praktis
Tabel ini memakai asumsi bobot 4-bit dan ruang runtime secara kasar, bukan jaminan kompatibilitas semua model.
| Skenario | Ryzen AI Max 128GB | DGX Spark 128GB | RTX 5090 32GB | H200 141GB | GB300 W775 |
|---|---|---|---|---|---|
| LLM 8B–14B | Sangat lega | Sangat lega | Sangat cepat | Berlebihan | Sangat berlebihan |
| LLM 32B | Muat | Muat | Muat dan cepat | Sangat lega | Sangat lega |
| LLM 70B | Muat | Muat | Umumnya perlu offload | Muat dan sangat cepat | Muat dan sangat cepat |
| LLM 120B | Muat dengan perencanaan | Muat dengan perencanaan | Tidak muat penuh | Muat | Sangat lega |
| LLM 405B | Tidak muat penuh | Tidak muat penuh | Tidak muat | Tidak muat pada satu GPU | Secara teoritis muat di HBM 4-bit; cek overhead |
| Banyak pengguna | Terbatas bandwidth | Terbatas bandwidth | Baik untuk model kecil | Sangat baik | Sangat baik |
Model Mixture-of-Experts perlu dibaca berbeda. Jumlah parameter aktif memengaruhi compute per token, tetapi seluruh atau sebagian besar bobot masih perlu tersedia di memori. Model 235B dengan 22B parameter aktif belum tentu memiliki kebutuhan memori seperti model dense 22B.
Mana yang Paling Worth It?
- Pengguna pribadi yang ingin mencoba model besar: Ryzen AI Max+ 395 128GB menawarkan kapasitas per rupiah terbaik.
- Developer CUDA yang memerlukan 128GB: DGX Spark memberi jalur ringkas dengan software stack NVIDIA.
- Inference cepat, image generation, dan PC serbaguna: RTX 5090 paling seimbang selama model muat dalam 32GB.
- Layanan AI data center: H200 cocok untuk pemakaian terus-menerus, banyak request, dan infrastruktur server.
- Model raksasa on-premises: GB300 relevan ketika kapasitas 128–141GB sudah tidak cukup.
Kesimpulan
Untuk LLM lokal, kapasitas menentukan apakah model dapat berjalan, sedangkan bandwidth menentukan seberapa nyaman model tersebut digunakan.
Pilih Ryzen AI Max+ 395 untuk kapasitas besar dengan anggaran paling rasional, DGX Spark untuk unified memory dan CUDA, RTX 5090 untuk performa tinggi pada model yang muat di VRAM, H200 untuk deployment data center, serta GB300 ketika kebutuhan sudah melampaui workstation biasa.
Sebelum membeli, tentukan model, quantization, context length, jumlah pengguna bersamaan, dan software stack. Perangkat tercepat tidak banyak membantu jika model tidak muat; memori terbesar juga belum tentu menyenangkan jika bandwidth terlalu rendah untuk target respons yang diinginkan.
Jika Anda masih ragu menentukan perangkat AI lokal yang paling sesuai dengan kebutuhan dan anggaran, Bandung Komputer siap membantu memilih konfigurasi yang tepat, mulai dari workstation personal hingga solusi AI untuk perusahaan.