wayanjimmy
ID

Mencari Model AI China Terbaik untuk Ngoding

Kalau kalian rajin mengikuti perkembangan AI akhir-akhir ini, pasti ngeh kalau peta kekuatan LLM sudah mulai bergeser. Kita gak lagi cuma terpaku sama model-model raksasa dari US. Model dari China mulai unjuk gigi dengan performa yang gila-gilaan tapi dengan harga yang miring banget.

Tulisan ini terinspirasi dari postingan menarik Mas Ariya Hidayat tentang “Perang Tanding Sonnet 4.6 vs Kimi”1 dan juga cuitan Rachel Nabors tentang konsep SAGE (Small and Good Enough)2. Di workflow ngoding sehari-hari, aku mulai mikir: “Gak harus selalu pakai frontier model yang mahal kan? Bisa gak ya kita pakai model yang lebih murah tapi ‘good enough’ buat beresin kerjaan?”

Untuk menjawab rasa penasaran itu, aku bikin sebuah proyek benchmark kecil-kecilan bernama Incident Desk di repositori deno-starter-llm-bench3. Tujuannya simpel: menguji tiga model AI asal China untuk mengimplementasikan aplikasi incident management di atas tech stack Deno & Fastify, lalu membandingkannya dengan baseline model US andalanku, Gemini 3.5 Flash.

Berikut hasil pertandingan dan analisisnya! wqwq.


Arena Pertandingan & Spesifikasi #

Aplikasi yang harus dibangun oleh para agent AI ini adalah Incident Desk—sebuah sistem manajemen insiden sederhana dengan entitas User, Team, Incident, Comment, dan Activity Event.

Meskipun aplikasinya terlihat simpel, ada beberapa aturan ketat (locked constraints) yang sengaja dipasang biar AI-nya gak gampang “curang”:

Mocin (Model Cina) yang diadu:

  1. DeepSeek (deepseek/deepseek-v4-flash)
  2. Qwen (qwen/qwen3.6-plus)
  3. Mimo (xiaomi/mimo-v2.5)

Dan sebagai baseline pembanding, aku pakai Gemini 3.5 Flash (antigravity/gemini-3.5-flash).


Data Hasil Pertandingan (Metrik & Cost) #

Setelah menjalankan pengujian end-to-end (E2E) menggunakan test harness khusus (scripts/eval-e2e.ts)4, performa masing-masing model dicatat secara detail. Biar gampang dibaca, aku rangkum dalam tabel di bawah ini:

ModelDurasi KerjaJumlah CallsToken BasisEstimasi BiayaSkor E2E
DeepSeek15m 54s32Pi session cumulative~$0.2190/100
Mimo1h 05m89Pi session cumulative~$0.50*90/100
Qwen45m 37s93Pi session cumulative~$2.3690/100
Gemini 3.5 Flash~5m 23s**80**agy CLI snapshot~$0.73***100/100

Beberapa catatan penting dari metrik di atas:

  • (*) Biaya Mimo disesuaikan berdasarkan pricing terbaru models.dev ($0.40/1M input, $2.00/1M output).
  • (**) Durasi Gemini mencerminkan fase implementasi utama. Total percakapan lengkap sekitar 15m 10s dengan 89 calls.
  • (***) Gemini diukur sebagai baseline dengan skor 100/100. Data pengukurannya menggunakan snapshot context window (agy CLI) yang basis tokennya berbeda dengan pelacakan kumulatif Pi session milik trio model China lainnya.

Siapa yang paling worth it ? #

Hal paling menarik dari hasil tes ini adalah ketiga model utama (DeepSeek, Qwen, Mimo) sama-sama meraih skor fungsional 90/100. Namun, cara mereka mencapai nilai tersebut sangatlah berbeda.

DeepSeek: Sang Jawara Efisiensi ($0.21) #

Kalau ditanya mana model yang paling mendekati definisi SAGE (Small and Good Enough), jawabannya mutlak DeepSeek.

Tampilan Insiden DeepSeek

Qwen: Solid tapi Boros Kantong ($2.36) #

Qwen menghasilkan antarmuka Pico-style yang fungsional dan secara umum mirip dengan hasil Mimo.

Tampilan Insiden Qwen

Mimo: Lambat tapi Konsisten ($0.50) #

Model besutan Xiaomi ini menunjukkan performa yang cukup tangguh, tapi jalannya sangat lambat.

Tampilan Insiden Mimo

Baseline: Gemini 3.5 Flash #

Gemini tetap menunjukkan kelasnya sebagai model frontier. Dia adalah yang tercepat dalam menulis kode dasar (hanya ~5 menit) dan menghasilkan tata letak visual/hierarki peran yang paling rapi dan profesional. Namun, biaya per token output-nya yang tinggi membuatnya terasa kurang ekonomis jika dipakai terus-menerus untuk iterasi coding yang panjang.

Tampilan Insiden Gemini 3.5 Flash


Pelajaran Krusial: Detail Kecil yang Sering Lolos #

Meskipun skornya 90/100, ada 10 poin yang gagal diselesaikan oleh ketiga model utama tersebut. Celah-celah ini menarik banget buat dipelajari karena sering kali merupakan kelemahan umum AI coder saat ini:

  1. Authorization Lintas Tim (Security Bug - 2 pts): Ini kesalahan paling fatal. Para model berhasil membatasi aksi edit/baca insiden, tapi mereka lupa membatasi pembuatan insiden (create incident). Hasilnya, akun Platform Agent masih bisa membuat insiden baru untuk tim Infra.
  2. Asset serving (Infrastructure Bug - 3 pts): Ketiganya lupa mendaftarkan static asset router di Fastify untuk berkas /public/app.js. Karena berkasnya gagal dimuat (HTTP 404), fitur progressive enhancement jadi mati total.
  3. Debounced Search (UX Bug - 5 pts): Taktik progressive enhancement untuk pencarian debounce gagal meng-update URL browser ke /incidents?q=....

Ini membuktikan bahwa kita tetap butuh mekanisme verifikasi mandiri atau back pressure5 di kontrak prompt kita. Jangan cuma menyuruh AI “buatkan aplikasi A”, tapi paksa mereka untuk membuktikan kalau tidak ada kebocoran authorization secara server-side.


Kesimpulan: Pilihan Akhir Workflow-ku #

Pengujian ini membuka mataku kalau DeepSeek beneran siap dipakai di workflow ngoding sehari-hari. Dengan biaya yang cuma sepeser ($0.21), performa kodingnya setara dengan model yang harganya 10x lipat lebih mahal.

Untuk workflow-ku sekarang, skema idealnya adalah menggunakan DeepSeek sebagai daily driver untuk eksplorasi kode awal dan menulis draf modular, lalu membawa catatan serah terima (handoff notes) ke Gemini 3.5 Flash jika butuh polesan visual UI kelas premium atau pemecahan logika arsitektur yang super rumit.

Kalau kalian sendiri, sudah coba pakai model China yang mana buat ngebantu ngoding?

Footnotes #

  1. Perang Tanding Sonnet 4.6 vs Kimi — Ariya Hidayat (Substack)

  2. Rachel Nabors tweet on SAGE (Small and Good Enough)

  3. wayanjimmy/deno-starter-llm-bench (GitHub)

  4. Git branch dan hasil implementasi benchmark lengkap (GitHub)

  5. Evolusi Workflow Coding Agent: Dari Cody, Amp, ke Pi — Wayan Jimmy

Subscribe