CompileDaily
AI

Anthropic Rilis Claude Sonnet 5.5: 30 Persen Lebih Cepat, Harga Tak Berubah, Skor Coding Salip Opus 5.5

Admin CompileDaily ·
Bagikan WhatsApp X Facebook Threads
Anthropic Rilis Claude Sonnet 5.5: 30 Persen Lebih Cepat, Harga Tak Berubah, Skor Coding Salip Opus 5.5

Original:AdminCompileDaily

Anthropic meluncurkan Claude Sonnet 5.5 pada Senin (28/9), model kelas menengah yang diklaim berjalan 30 persen lebih cepat dari Sonnet 5 dengan tarif API yang sama, dan di beberapa uji coding agentic justru mengungguli Opus 5.5 yang baru dirilis sepekan sebelumnya.

Model ini diposisikan sebagai rekan kerja harian yang lebih murah dan lebih gesit, sementara Opus tetap menjadi opsi untuk pekerjaan paling berat.

Harga Tetap, Biaya per Tugas Turun

Tarif Sonnet 5.5 tidak berubah dari pendahulunya: $2 per juta token input dan $10 per juta token output, dengan cache read $0,20 dan cache write $2,50. Penghematan datang dari sisi lain. Karena kecepatan output naik dan jumlah pemanggilan tool berkurang, Anthropic menyebut biaya untuk tugas yang umum bisa turun hingga 30 persen.

Pada pengaturan effort rendah atau menengah, Sonnet 5.5 bahkan disebut bisa melampaui skor terbaik Sonnet 5 dengan biaya per tugas sekitar sepersepuluhnya.

Skor Coding Melampaui Opus 5.5

Di Terminal-Bench 4.0, Sonnet 5.5 mencetak 70,6 persen, di atas Opus 5.5 yang mendapat 66,4 persen. Di uji lain Opus 5.5 masih unggul tipis: FrontierCode 1.1 (52,1 persen berbanding 54,4 persen) dan CursorBench 4.0 (55,5 persen berbanding 57,8 persen).

Untuk pekerjaan pengetahuan umum, selisihnya nyaris hilang. Sonnet 5.5 meraih 1844 poin di GDPval-AA v2.1, hanya dua poin di bawah Opus 5.5 (1846) dan jauh di atas Sonnet 5 (1449). Di OSWorld 2.1, uji penggunaan komputer, skornya 80,1 persen, naik dari 57 persen pada Sonnet 5. Di Humanity's Last Exam dengan bantuan tools, skornya 64,5 persen dari sebelumnya 54,9 persen.

Anthropic juga menyebut Sonnet 5.5 sebagai model Sonnet pertama yang berhasil menamatkan Pokémon Red hanya dari tangkapan layar, sebagai gambaran kemampuan visualnya.

Lihat Layanan Kami

Kata Para Pengguna Awal

Sejumlah perusahaan yang menguji lebih dulu memberi angka konkret. Box menyebut Sonnet 5.5 lebih akurat, 2,4 kali lebih cepat, dan memakai 12 persen lebih sedikit token untuk tugas keuangan dan kesehatan yang sensitif. Zendesk melaporkan tiket dukungan diproses 20 persen lebih cepat dengan lebih sedikit keputusan keliru.

Slack mengatakan model ini mengungguli Sonnet 5 di hampir semua evaluasi tanpa mengubah prompt, dengan 14 persen lebih sedikit token output. Atlassian menyebut agen Rovo bisa berjalan hingga 30 persen lebih cepat, sedangkan Lovable mencatat sepertiga lebih sedikit pemanggilan tool dan sekitar setengah eksekusi shell yang lebih sedikit.

Pengaman Siber Naik Kelas

Untuk pertama kalinya, model Sonnet punya kemampuan keamanan siber yang sebanding dengan Opus, sehingga dikenai pengaman serupa. Tugas siber berisiko tinggi dialihkan ke Sonnet 5, sementara pengembang bisa mengajukan akses bertingkat lewat Cyber Verification Program.

Sonnet 5.5 juga model Sonnet pertama yang dilengkapi pengklasifikasi untuk mencegah ekstraksi penalaran, langkah yang berkaitan dengan kekhawatiran distilasi model di industri. Dalam audit perilaku otomatis sekitar 1.850 skenario, Anthropic mengklaim hasilnya setara atau lebih baik dari Sonnet 5 di sebagian besar ukuran.

Tersedia di Semua Platform, Haiku Menyusul

Sonnet 5.5 sudah tersedia di Claude Platform, Amazon Web Services, Google Cloud, dan Microsoft Azure. Anthropic juga berencana merilis model Haiku terbaru dalam beberapa pekan ke depan untuk kebutuhan volume tinggi yang sensitif biaya, meski belum menyebut jadwal pastinya.

Peluncuran ini menambah tekanan pada kompetitor. Dengan tarif $2/$10, Sonnet 5.5 berada di level harga yang sama dengan GPT-6 Sol milik OpenAI, sehingga persaingan bergeser dari sekadar harga per token ke seberapa banyak pekerjaan yang bisa diselesaikan untuk setiap dolar yang dikeluarkan.

Komentar (0)

Masuk untuk menulis komentar.

Belum ada komentar.

Kami memakai cookie untuk analisis kunjungan. Baca Kebijakan Privasi kami.