CompileDaily
AI

Anthropic Rilis Claude Opus 5, Model Keempat dalam Dua Bulan dengan Klaim Setengah Harga Fable 5

Admin CompileDaily ·
Bagikan WhatsApp X Facebook Threads

Hanya dalam kurun waktu kurang dari dua bulan, satu lab AI ini sudah merilis model baru untuk keempat kalinya, dan yang terbaru datang dengan pesan yang jarang dipakai perusahaan teknologi untuk produk andalan mereka: bukan soal kemampuan baru, melainkan soal harga.

Anthropic merilis Claude Opus 5 pada Kamis, 24 Juli 2026, dan langsung tersedia hari itu juga di Claude API, Claude.ai, Claude Code, serta Claude Cowork, dengan model ID claude-opus-5. Model ini menjadi rilis keempat Anthropic dalam kurun kurang dari dua bulan, menyusul Mythos 5, Fable 5, dan Sonnet 5 yang semuanya diluncurkan pada Juni 2026.

Diposisikan sebagai Model Harian, Bukan Sekadar Andalan

Berbeda dari peluncuran model flagship pada umumnya yang biasanya menonjolkan batas kemampuan baru, Anthropic memilih membingkai Opus 5 dari sisi ekonominya. Perusahaan menyebut model ini "mendekati kecerdasan frontier Claude Fable 5 dengan setengah harga", dan dirancang untuk dipakai setiap hari, bukan disimpan khusus untuk masalah-masalah paling sulit.

Dari sisi harga, mode standar Opus 5 dibanderol 5 dolar AS per juta token input dan 25 dolar AS per juta token output, persis sama dengan pendahulunya, Opus 4.8, dan tepat separuh dari harga input Fable 5 yang mencapai 10 dolar AS. Bagi yang membutuhkan kecepatan lebih tinggi, tersedia mode Fast dengan harga dua kali lipat yakni 10 dolar AS dan 50 dolar AS, namun berjalan sekitar 2,5 kali lebih cepat dari mode standar.

Fitur Baru: Pengaturan Effort Bertingkat

Salah satu fitur baru yang diperkenalkan bersama Opus 5 adalah pengaturan effort atau tingkat usaha reasoning, yang bisa dipilih per permintaan dalam tiga level yaitu low, medium, dan high. Pengaturan low membuat model bekerja lebih cepat dan murah untuk tugas-tugas rutin, sementara pengaturan high memberi model waktu lebih panjang untuk bernalar pada masalah yang lebih kompleks. Fitur ini pada dasarnya menjadi tuas yang memungkinkan pengguna menyeimbangkan biaya dengan kemampuan sesuai kebutuhan masing-masing tugas.

Dari sisi spesifikasi teknis, Opus 5 dilengkapi jendela konteks hingga 1 juta token, output maksimum 128 ribu token, dan batas pengetahuan hingga Mei 2026, menjadikannya model Claude dengan data paling terkini dibanding seri Claude lainnya yang pernah dirilis.

Klaim Benchmark yang Mengungguli Sejumlah Kompetitor

Menurut data yang dipublikasikan Anthropic sendiri, Opus 5 mencatatkan skor 43,3 persen pada benchmark FrontierBench v0.1 di tingkat usaha maksimum, lebih dari dua kali lipat skor Opus 4.8 yang berada di kisaran 18,7 hingga 21,1 persen. Skor ini diklaim mengungguli seluruh model pesaing yang diuji, termasuk Fable 5 yang mencatatkan 33,7 persen dan GPT-5.6 Sol milik OpenAI di angka 37,5 persen.

Lihat Layanan Kami

Pada benchmark CursorBench 3.2, Opus 5 diklaim berada dalam jarak 0,5 persen dari puncak performa Fable 5, namun dengan biaya hanya separuhnya per tugas. Sementara pada OSWorld 2.0, Opus 5 disebut melampaui hasil terbaik Fable 5 dengan biaya sekitar sepertiganya saja. Di ranah pengujian penalaran abstrak ARC-AGI-3, Opus 5 mencatatkan skor 30,16 persen pada usaha tinggi, diklaim tiga kali lipat model terbaik berikutnya. Pada ARC-AGI-1 yang diverifikasi ARC Prize Foundation, Opus 5 bahkan mencapai skor 97,50 persen di usaha maksimum.

Salah satu pencapaian yang cukup menonjol datang dari ranah matematika. Pada soal-soal International Mathematical Olympiad 2026, Opus 5 berhasil menjawab 42 dari 42 soal, dengan seluruh 24 pembuktian yang dihasilkan model diterima oleh panel penilaian tiga model, ditambah enam pembuktian yang sudah ditentukan sebelumnya mendapat nilai penuh dari para pakar manusia yang menilai.

Tidak Menang di Semua Lini

Meski klaim performanya cukup mengesankan, Opus 5 tidak sepenuhnya unggul di segala aspek. Sejumlah sumber independen mencatat bahwa GPT-5.6 Sol masih sedikit lebih unggul pada salah satu tes agentic-coding tertentu. Sementara itu, untuk topik kesehatan dan biologi, keunggulan tetap dipegang oleh Claude Mythos 5, model Anthropic lain yang dirilis lebih dulu pada Juni 2026.

Perlu dicatat pula soal metodologi pengujian yang diungkapkan Anthropic sendiri. Angka FrontierBench v0.1 tersebut berasal dari pengujian internal menggunakan mini-SWE-agent harness dengan backend GKE, mengambil rata-rata reward dari lima kali percobaan pada setiap tugas. Anthropic juga mengungkapkan bahwa Opus 4.8 berfungsi sebagai model cadangan (fallback) saat classifier keamanan menolak suatu permintaan, baik untuk Opus 5 maupun Fable 5. Artinya, skor coding utama yang dipublikasikan bukan sepenuhnya hasil murni dari satu model tunggal saja. Meski metodologi ini diungkapkan secara transparan oleh Anthropic, angka 43,3 persen tersebut tetap perlu dipahami sebagai hasil pengujian internal vendor, bukan evaluasi pihak ketiga yang sepenuhnya independen.

Klaim Keselarasan dan Privasi Data

Dari sisi keamanan, Anthropic mengeklaim Opus 5 sebagai model mereka yang paling selaras (aligned) sejauh ini, dengan tingkat perilaku deceptive atau menipu yang paling rendah yang pernah mereka ukur pada model Claude mana pun. Opus 5 juga mendukung kebijakan zero data retention, berbeda dengan Fable 5 yang mensyaratkan masa retensi data selama 30 hari.

Tekanan bagi Vendor Lain di Industri

Sejumlah analis independen menilai keputusan Anthropic mempertahankan harga tier Opus tetap sama sambil mengklaim performa mendekati Fable 5 berpotensi menekan vendor-vendor lain yang menjual token model frontier dengan harga premium. Jika klaim benchmark coding dan otomatisasi ini terbukti konsisten saat diuji langsung oleh tim enterprise pada beban kerja mereka masing-masing, sejumlah pihak memperkirakan bisa memicu negosiasi ulang kontrak inferensi model frontier di kalangan perusahaan sebelum akhir tahun ini.

Komentar (0)

Masuk untuk menulis komentar.

Belum ada komentar.

Kami memakai cookie untuk analisis kunjungan. Baca Kebijakan Privasi kami.