Anthropic merilis Claude Opus 5.5 dengan fokus pada pekerjaan yang membutuhkan kombinasi penalaran, penggunaan tool, dan ketekunan dalam menyelesaikan tugas. Model ini diposisikan untuk agentic coding, pekerjaan pengetahuan, penggunaan komputer, serta riset ilmiah yang berlangsung melalui beberapa langkah.
Yang menarik dari rilis ini bukan hanya klaim bahwa modelnya lebih mampu. Anthropic menyertakan tabel benchmark yang memperlihatkan performa Opus 5.5 pada sejumlah evaluasi. Data tersebut memberi developer titik awal untuk memahami area yang menjadi kekuatan model, sekaligus mengingatkan bahwa benchmark tetap harus dibaca dengan hati-hati.
Hasil pada coding dan pekerjaan agent
Claude Opus 5.5 mencatat 66,4 persen pada Terminal-Bench 4.0. Pada FrontierCode v1.1, skornya 54,4 persen, sedangkan CursorBench 4.0 mencatat 57,8 persen. Ketiganya relevan bagi developer karena menguji kemampuan menyelesaikan pekerjaan coding yang tidak berhenti pada satu potongan fungsi.
Dalam project nyata, kemampuan tersebut dapat membantu membaca struktur repository, mencari penyebab bug, mengusulkan perubahan lintas file, dan menulis test. Namun agent tetap perlu bekerja dengan tool yang dibatasi. Akses baca repository tidak otomatis berarti model boleh mengubah database, menghapus file, atau melakukan deployment.
Benchmark knowledge work dan computer use
Pada GDPval-AA v2.1 untuk knowledge work, Anthropic mencatat skor 1846. Untuk AutomationBench, skornya 40,0 persen. Pada Humanity's Last Exam, Opus 5.5 memperoleh 67,7 persen dengan tools. Angka-angka ini menunjukkan bahwa model tidak hanya diarahkan untuk menulis kode, tetapi juga menangani tugas analitis dan pekerjaan lintas bidang.
Untuk computer use, hasil yang dicantumkan adalah 81,8 persen partial pada OSWorld 2.0. Label partial penting karena menunjukkan bahwa keberhasilan benchmark tidak sama dengan kemampuan menjalankan semua alur komputer tanpa pengawasan. Aplikasi yang memberi agent akses browser harus tetap memiliki konfirmasi untuk tindakan yang berisiko, seperti mengirim pesan, mengubah data, atau melakukan pembelian.
Riset dan batas membaca skor
Anthropic juga mencantumkan 58,7 persen pada Terminal-Bench-Science 0.1. Hasil ini menarik untuk workflow riset yang membutuhkan pencarian, pengolahan informasi, dan penggunaan tool. Meski begitu, temuan ilmiah tetap membutuhkan pemeriksaan sumber dan validasi manusia.
Anthropic sendiri mengingatkan bahwa margin benchmark pada level kemampuan seperti ini semakin kurang dapat dijadikan gambaran tunggal untuk penggunaan nyata. Karena itu, tim sebaiknya membuat evaluasi internal dari tugas yang benar-benar dikerjakan pengguna. Ukur kualitas hasil, latency, biaya token, frekuensi koreksi, dan dampak kesalahan.
Claude Opus 5.5 layak dipertimbangkan untuk aplikasi yang membutuhkan reasoning dan agent workflow lebih dalam. Adopsinya akan berhasil jika kemampuan model diimbangi dengan desain tool yang aman, observability, pengujian regresi, dan review manusia pada keputusan penting.
Sumber resmi Anthropic: https://www.anthropic.com/claude-opus-5-5
Transparansi: Artikel ini disusun bersama Codekop AI berdasarkan sumber yang tercantum, kemudian ditinjau dan disunting oleh Fauzan Falah. AI dapat keliru, jadi silakan cek kembali sumber asli.