Gemini 3.7 Flash: Model Workhorse untuk Coding dan Agent Workflow
Google memperkenalkan Gemini 3.7 Flash untuk coding, web development, dan agent workflow, dengan benchmark serta harga pengantar yang perlu dibaca dalam konteksnya.
Google memperkenalkan Gemini 3.7 Flash pada 13 Agustus 2026 sebagai model workhorse untuk coding dan agent. Pengumuman resminya menyebut peningkatan pada software engineering, knowledge work, dan web development dibanding Gemini 3.6 Flash. Namun angka benchmark dan harga yang tercantum tetap perlu dibaca sebagai klaim vendor pada konfigurasi evaluasi tertentu, bukan jaminan untuk setiap workload.
1. Apa Itu Gemini 3.7 Flash?
Gemini 3.7 Flash adalah model dalam seri Flash yang menurut Google ditujukan untuk workflow kompleks, termasuk debugging, issue resolution, pembuatan aplikasi web, dan tool call multi-step. Google juga menyebut model ini lebih baik dalam beradaptasi ketika menemui roadblock, meminta klarifikasi, dan mengikuti instruksi dengan lebih konsisten.
Untuk developer, positioning ini berarti model tidak hanya dinilai dari jawaban chat. Fokusnya adalah seberapa sering model dapat menyelesaikan rangkaian pekerjaan dengan intervensi manual dan retry yang lebih sedikit. Klaim tersebut tetap berasal dari materi Google dan perlu diuji pada repository, tools, dan pola prompt Anda sendiri.
2. Apa yang Dilaporkan Benchmark?
Pengumuman Google mencantumkan skor FrontierCode 1.1 Main sebesar 43,6% untuk Gemini 3.7 Flash dibanding 34,4% pada 3.6 Flash, serta DeepSWE v1.1 sebesar 65,3% dibanding 49,0%. Untuk web development, Google menyebut WebDev Arena Elo 1588 dibanding 1538. Di GDP.pdf, angkanya 34,0% dibanding 22,0%, sedangkan AutomationBench mencatat 30,4% dibanding 17,0%.
Angka ini membantu menunjukkan arah peningkatan, tetapi tidak menjawab latency, error recovery, biaya retry, atau kualitas output pada aplikasi tertentu. Tim tetap perlu membuat eval set internal sebelum mengganti model production.
3. Harga dan Ketersediaan
Google menyebut harga pengantar sampai akhir 2026 sebesar $0,75 per satu juta input token dan $3,75 per satu juta output token. Mulai 1 Januari 2027, angka yang diumumkan menjadi $1,50 dan $7,50. Harga per token saja belum cukup untuk menghitung biaya: tool call, context panjang, output berulang, dan human review ikut menentukan total cost per workflow.
4. Cara Membaca Rilis Ini
Gemini 3.7 Flash layak diuji untuk coding assistant, automation, dan agent yang membutuhkan planning. Mulai dengan workload yang dapat diukur: pass rate, correction rate, latency, token usage, dan jumlah retry. Jangan mengganti model hanya karena skor headline terlihat lebih tinggi. Hasil evaluasi Google dan diskusi Hacker News memberi konteks awal, sementara keputusan production tetap membutuhkan pengujian yang sesuai sistem Anda.
Referensi: https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/