Perbandingan pelican Simon Willison menunjukkan efek reasoning level
Oleh Zai · Let's Make It Easy
Dipublikasikan 2026-09-05
Eksperimen Simon Willison membandingkan model gambar dan reasoning levels dengan tugas SVG pelican yang sama.
Simon Willison membuat perbandingan yang sengaja absurd tetapi cukup informatif: beberapa model diminta menghasilkan SVG pelican yang sedang mengendarai sepeda. Hasilnya disusun dalam grid agar perbedaan kualitas dapat dilihat berdampingan, bukan hanya dibahas lewat klaim umum.
1. Apa yang dibandingkan?
Tulisan tersebut membandingkan GPT-6 Astra pada level reasoning low, medium, high, dan xhigh dengan GPT-5.6 Sol, Terra, dan Luna. Astra tidak menyediakan mode reasoning none dalam eksperimen itu. Karena prompt dan objeknya dibuat sama, pembaca dapat melihat perubahan bentuk, detail, dan konsistensi secara langsung.
2. Temuan pada contoh pelican
Menurut observasi Willison, hasil Astra terlihat lebih baik pada grid tersebut. Ia menulis bahwa Astra low menghasilkan pelican yang lebih baik daripada model Sol yang ia bandingkan pada tingkat reasoning berbeda. Astra max terlihat sangat baik, walaupun kaki pelican belum selalu benar pada semua level di bawah max.
Eksperimen ini juga mencatat input token serta perkiraan biaya. Willison memperkirakan Astra memiliki harga per token lebih tinggi daripada Sol, tetapi menggunakan token lebih sedikit pada level yang diuji. Perbandingan biaya akhirnya tidak sesederhana melihat harga per juta token.
3. Mengapa format grid berguna?
Membandingkan output dalam satu panel memaksa kita melihat detail yang sering hilang dalam demo tunggal. Kita bisa memeriksa apakah objek memiliki bagian tubuh yang konsisten, apakah komposisi berubah, dan apakah reasoning tambahan benar benar membantu. Untuk pekerjaan produksi, format seperti ini dapat diubah menjadi eval set kecil dengan prompt yang relevan dengan kebutuhan tim.
OpenAI mendokumentasikan kemampuan image generation secara umum, tetapi halaman dokumentasi tersebut tidak memverifikasi hasil spesifik Astra pada tulisan Willison. Jadi angka biaya dan kualitas di sini harus dianggap sebagai hasil eksperimen penulis, bukan angka resmi universal.
4. Cara memakai ide ini
Jika sedang memilih model gambar, buat beberapa prompt tetap yang mewakili pekerjaan nyata. Simpan output, latency, token, dan biaya. Nilai juga kegagalan kecil yang mengganggu workflow, bukan hanya gambar yang paling bagus. Pelican bisa menjadi demo lucu, tetapi eval yang baik harus menjawab kebutuhan sebenarnya.
5. Dari demo ke evaluasi
Grid visual seperti ini dapat menjadi awal evaluasi internal, tetapi prompt perlu diperbanyak dan kriteria harus ditulis sebelum hasil dilihat. Untuk aplikasi nyata, tambahkan contoh dengan teks kecil, komposisi tertentu, dan kebutuhan brand. Simpan semua output agar perbandingan berikutnya tidak bergantung pada ingatan. Biaya per request juga perlu dicatat bersama kualitas, karena gambar yang lebih bagus belum tentu lebih murah atau lebih cepat. Simpan juga prompt dan setting yang dipakai.
Referensi: https://simonwillison.net/2026/Sep/4/astra-pelicans/