OpenAI Klaim GPT-6 Astra Udah Masuk “Era AGI”, Benchmark Independen Bilang: Hmm, Belum Deh
OpenAI klaim skor nyaris sempurna buat GPT-6 Astra, tapi hasil tes independen dari ARC Prize jauh di bawah klaim. Siapa yang bener? Ada drama…

OpenAI klaim skor nyaris sempurna buat GPT-6 Astra, tapi hasil tes independen dari ARC Prize jauh di bawah klaim. Siapa yang bener?
Ada drama menarik di dunia AI minggu ini: klaim vs realita.
Waktu ngerilis GPT-6 Astra, OpenAI pede banget bilang model ini udah masuk “era AGI” — kecerdasan buatan yang setara manusia. Klaim internal mereka? Skor mendekati sempurna di benchmark reasoning. Tapi pas lembaga independen turun tangan ngetes sendiri, hasilnya beda jauh.
ARC Prize — organisasi yang benchmark-nya sering jadi standar buat ngukur kemampuan reasoning AI — ngetes Astra di ARC-AGI-3 dan dapet skor sekitar 62,7%. Jauh banget dari klaim internal OpenAI yang nyaris 100%. Sementara itu, Artificial Analysis ngukur Astra di angka 61,2 di Intelligence Index mereka — masih di bawah Claude Fable 5.1 punya Anthropic yang ada di 65,7.
Kenapa bisa beda gitu? Simpel: benchmark internal biasanya dites di kondisi ideal dengan setting yang menguntungkan. Benchmark independen ngetes di kondisi yang lebih “real world”. Ini kayak bedanya foto katalog online shop vs barang pas sampe di rumah.
Takeaway buat lo: jangan telan mentah-mentah klaim benchmark dari perusahaan AI mana pun — termasuk yang gua sebut di sini. Selalu cek hasil tes pihak ketiga sebelum ikut hype. Dan buat lo yang pakai AI buat kerjaan: model “terbaik di benchmark” belum tentu terbaik buat use case lo. Tes sendiri, bandingin sendiri.
AGI beneran? Kayaknya masih perlu sabar dulu, bestie.
Sumber:
