Anthropic kembali mengejutkan dunia kecerdasan buatan dengan meluncurkan Claude Opus 5.5, model terbaru mereka yang diklaim sebagai rilis pertama sejak seruan untuk memperlambat laju pengembangan frontier AI. Model ini telah diuji sebelum peluncuran oleh evaluator eksternal, termasuk Frontier Design dan METR. Dalam audit perilaku otomatis yang merupakan tes alignment paling komprehensif yang dijalankan Anthropic, Opus 5.5 menjadi model dengan performa terbaik yang pernah diuji hingga saat ini. Model ini juga dilengkapi dengan pengamanan yang dikembangkan untuk model-model paling canggih mereka.
Peluncuran Opus 5.5 menandai lompatan besar dari pendahulunya, Opus 5. Berbagai peningkatan signifikan hadir di bidang performa, keamanan, biaya, kecepatan, dan gaya komunikasi. Anthropic mengklaim bahwa Opus 5.5 adalah model terdepan baru mereka, dan para penguji awal melihat lonjakan besar dalam performa pada pekerjaan paling kompleks mereka.
Performa yang Mengesankan
Salah satu penguji awal berhasil menyelesaikan migrasi kode sebanyak 680.000 baris dalam waktu kurang dari satu hari—pekerjaan yang biasanya memakan waktu berminggu-minggu bagi tim engineering. Opus 5.5 juga sangat baik dalam menemukan dan memperbaiki inefisiensi dalam perangkat lunak. Ketika diminta memangkas waktu muat di setiap halaman aplikasi web, Opus 5.5 berhasil 39 dari 40 kali, sementara Opus 5 hanya membuat perbaikan kecil yang juga mengubah perilaku aplikasi. Penguji lain meminta beberapa model Claude membangun game dari satu prompt; Opus 5.5 mencetak skor lebih tinggi dari model lain berkat kekuatan grafis dan polesannya.
Keamanan Terbaik di Kelasnya
Opus 5.5 mencapai skor terbaik dari model mana pun hingga saat ini pada audit perilaku otomatis, rangkaian alignment yang menguji Claude dalam ribuan skenario simulasi. Model ini jauh lebih kecil kemungkinannya untuk mengambil tindakan yang sulit dibalik atau bertindak di luar batas yang diberikan, dan lebih tahan terhadap prompt injection dibandingkan Opus 5. Anthropic juga memperluas pengujian alignment untuk mencakup tugas-tugas yang lebih panjang, tugas yang mustahil, dan skenario yang dimodelkan dari insiden nyata. Detail lengkap evaluasi tersedia di System Card Opus 5.5.
Karena Opus 5.5 sebanding dengan Claude Mythos 5.1 dalam biologi dan keamanan siber, Anthropic menerapkannya dengan pengamanan serupa seperti pada Claude Fable 5.1. Organisasi yang telah diverifikasi dapat mengajukan permohonan ke Life Sciences Verification Program untuk menggunakan Opus 5.5 dalam penelitian biologi. Dalam beberapa pekan ke depan, akses ke Cyber Verification Program juga akan diperluas, dan praktisi keamanan siber yang terverifikasi dapat menggunakan Opus 5.5 untuk pekerjaan mereka.
Biaya dan Kecepatan
Opus 5.5 memerlukan komputasi lebih sedikit untuk melayani dibandingkan Opus 5, dan harganya mencerminkan hal itu. Tes Anthropic menunjukkan bahwa pada pengaturan default, biayanya 40% lebih murah daripada Opus 5 pada beban kerja tipikal. Token input dan output masing-masing $4 dan $20 per juta, 20% lebih murah dari Opus 5. Pembacaan cache (yang menyusun mayoritas biaya pekerjaan agentic dan coding) adalah $0,20 per juta token, 60% lebih murah dari Opus 5. Opus 5.5 juga menghasilkan output lebih dari 30% lebih cepat daripada Opus 5.
Selain penurunan harga, Anthropic meningkatkan batas penggunaan lima jam pada paket Pro, Max, Team, dan Enterprise berbasis kursi. Pengguna langganan juga mendapatkan reset rate limit yang dapat disimpan dan digunakan kapan saja.
Komunikasi yang Lebih Alami
Opus 5.5 berkomunikasi lebih alami daripada model sebelumnya. Penguji awal menemukan tulisannya lebih jelas dan mudah diikuti, menjawab beberapa umpan balik umum tentang Opus 5. Model ini menempatkan informasi paling penting di depan, dan gayanya membuatnya menjadi mitra kerja yang lebih baik dalam sesi panjang. Seorang penguji awal mengatakan, “Ia menulis seperti saya.” Dalam penggunaan Anthropic sendiri, hal ini membuat pekerjaan Opus 5.5 lebih mudah diikuti dan diperiksa—yang merupakan manfaat keamanan sekaligus praktis.
Claude Sonnet 5.5 dan Claude Haiku 5.5 akan menyusul dalam beberapa pekan ke depan, dengan banyak peningkatan yang sama pada performa, efisiensi, dan keamanan.
Performa dan Efisiensi Biaya
Pada benchmark Anthropic, Claude Opus 5.5 memimpin dalam agentic coding, computer use, dan knowledge work. Meskipun demikian, pada tingkat kemampuan ini, margin benchmark menjadi panduan yang kurang dapat diandalkan untuk perbedaan dunia nyata. Dalam penggunaan Anthropic sendiri, kesenjangan antara Opus 5.5 dan Claude Fable 5.1 lebih sempit daripada yang ditunjukkan skor tersebut.
Berikut beberapa hasil benchmark:
-
Agentic coding Terminal-Bench 4.0: Opus 5.5 66,4%, Fable 5.1 55,8%, Opus 5 52,3%, GPT-6 Astra 57,9%, GPT-5.6 Sol 37,3%.
-
Agentic coding FrontierCode v1.1 (Main): Opus 5.5 54,4%, Fable 5.1 50,3%, Opus 5 48,0%, GPT-6 Astra 53,3%, GPT-5.6 Sol 47,5%.
-
Agentic coding CursorBench 4.0: Opus 5.5 57,8%, Fable 5.1 51,8%, Opus 5 46,6%, GPT-5.6 Sol 41,7%.
-
Knowledge work GDPval-AA v2.1: Opus 5.5 1846, Fable 5.1 1735, Opus 5 1708, GPT-6 Astra 1542, GPT-5.6 Sol 1588.
-
Business workflows AutomationBench: Opus 5.5 40,0%, Fable 5.1 31,4%, Opus 5 26,9%, GPT-6 Astra 41,4%, GPT-5.6 Sol 28,8%.
-
Multidisciplinary reasoning Humanity's Last Exam: Opus 5.5 67,7% with tools, Fable 5.1 65,6% with tools, Opus 5 63,6% with tools, GPT-6 Astra 57,2% with tools.
-
Agentic scientific research Terminal-Bench-Science 0.1: Opus 5.5 58,7%, Fable 5.1 52,6%, Opus 5 29,0%, GPT-6 Astra 64,6%, GPT-5.6 Sol 22,4%.
-
Computer use OSWorld 2.0: Opus 5.5 81,8% partial, Fable 5.1 80,7% partial, Opus 5 74,0% partial.
-
Visual chart recognition Chartography: Opus 5.5 89,0% with tools, Fable 5.1 88,4% with tools, Opus 5 83,4% with tools.
Keunggulan Opus 5.5 yang sangat jelas adalah efisiensi. Biaya per token lebih rendah dari Opus 5 dan menggunakan lebih sedikit token per tugas, yang secara total menurunkan biaya hingga 40%.
Harga per 1 juta token:
-
Cache reads: Opus 5.5 $0,20 vs Opus 5 $0,50
-
Input tokens: $4 vs $5
-
Output tokens: $20 vs $25
-
Cache writes: $5 vs $6,25
Fast mode untuk Opus 5.5 juga tersedia di Claude Code dan Claude Platform dengan kecepatan hingga 2,5x. Biayanya $8 per juta token input dan $40 per juta token output.
Coding
Opus 5.5 sangat baik untuk pekerjaan panjang dan luas seperti migrasi dan audit seluruh basis kode. Seorang penguji awal menggunakannya untuk mengaudit dan memperbaiki basis kode 200.000 baris dalam waktu kurang dari tiga jam, di mana Opus 5 membutuhkan lebih dari 20 jam dan menggunakan 2,5x token lebih banyak. Dalam tes internal, Anthropic meminta Opus 5.5 dan Fable 5.1 menerjemahkan HAProxy, perangkat lunak populer yang menyeimbangkan beban lalu lintas web antar server, dari C ke Rust. Kedua penulisan ulang hampir lulus semua tes regresi HAProxy sendiri, tetapi Opus 5.5 selesai dalam 9,5 jam dibandingkan 12 jam untuk Fable 5.1, dan biayanya 51% lebih murah.
Opus 5.5 memberikan hasil frontier pada agentic coding dengan biaya sebagian kecil. Pada tingkat effort default di FrontierCode, ia mengalahkan GPT-6 Astra dengan biaya sekitar 20% per tugas. Pada Terminal Bench 4.0, ia menyamai Astra dengan biaya sekitar 40%, sementara di CursorBench ia mengalahkan GPT-5.6 Sol dengan selisih 11 poin dengan biaya sekitar sepertiganya.
Para penguji awal melaporkan keunggulan efisiensi dan kecerdasan yang serupa. GitHub, Clio, Lovable, Quantium, Spotify, Optiver, Column, dan Kiro termasuk di antara mereka. Mario Rodriguez, Chief Product Officer GitHub, mengatakan, “Pengembang menginginkan agen yang dapat mengambil pekerjaan perangkat lunak nyata dan menyelesaikannya. Dalam pengujian kami di GitHub Copilot CLI dan VS Code, Claude Opus 5.5 menggunakan token dan langkah paling sedikit yang kami ukur. Di VS Code, ia menyelesaikan lebih banyak tugas terminal daripada Opus 5 dalam kurang dari setengah langkah. Lebih dari sekadar membuat tugas individu lebih efisien, ia membuat proyek besar pengembang lebih dapat dicapai.”
Agen Coding Paling Aman
Perusahaan yang menggunakan agen dalam sistem mereka perlu tahu bahwa agen tersebut beroperasi sebagaimana mestinya, terutama ketika mereka berjalan otonom selama berjam-jam. Opus 5.5 memiliki classifier yang menyaring setiap tindakan sebelum dijalankan, sandbox open-source yang dapat diaudit tim keamanan, dan code review yang menangkap kerentanan sebelum digabungkan.
Model itu sendiri juga memiliki pertahanan yang lebih kuat. Pada serangan prompt injection, ia menyamai atau mengalahkan Opus 5 di setiap pengaturan yang diuji, termasuk coding, penggunaan alat, penggunaan komputer, dan penjelajahan web. Pada benchmark yang dijalankan oleh firma keamanan AI Gray Swan, Opus 5.5 menyamai Fable 5.1 untuk tingkat keberhasilan prompt injection terendah dari model mana pun yang diuji.
Knowledge Work
Opus 5.5 adalah peneliti yang andal dan cakap. Dalam satu tes internal, Anthropic meminta Opus 5.5, Fable 5.1, dan Opus 5 menulis laporan tentang kinerja kuartalan perusahaan hanya menggunakan informasi yang dapat mereka temukan di salinan web di mana rilis pendapatan sulit ditemukan. Sebuah penilai otomatis memeriksa setiap angka dan kutipan terhadap sumber. Di berbagai pengaturan effort, 16 dari 18 laporan Opus 5.5 memenuhi standar kualitas Anthropic, di mana angka atau kutipan yang diciptakan akan gagal. Baik Fable 5.1 maupun Opus 5 tidak memenuhi standar itu dalam upaya apa pun.
Opus 5.5 juga kuat dalam analisis keuangan dan pekerjaan bisnis. Walleye Capital, firma investasi dan penguji awal, melaporkan bahwa Opus 5.5 sebagian besar menyelesaikan rangkaian evaluasi mereka pada pengaturan terendahnya; pada pengaturan lebih tinggi, performanya bahkan lebih baik, menemukan kesalahan dalam instruksi evaluasi mereka dan mengoreksinya. Tidak ada model lain yang pernah menangkap kesalahan ini sebelumnya.
Dalam tes lain, Anthropic menugaskan Opus 5.5 dan Opus 5 untuk menganalisis usulan merger antara dua perusahaan perangkat lunak HR fiktif. Masing-masing membangun model keuangan di Excel, lalu mengubahnya menjadi presentasi eksekutif tentang apakah kesepakatan itu masuk akal pada harganya. Kedua model mencapai kesimpulan yang sama, tetapi model Opus 5.5 lebih menyeluruh dan presentasinya lebih mudah dibaca, sementara Opus 5 memiliki kesalahan kecil. Opus 5.5 selesai dalam 63 menit dibandingkan 93 menit untuk Opus 5, dan biayanya 50% lebih murah.
Pada evaluasi knowledge work, Opus 5.5 mengungguli model lain sekaligus menggunakan lebih sedikit token. Pada GDPval-AA v2.1, tes pekerjaan dunia nyata di 44 okupasi, Opus 5.5 mencetak 1846 Elo, di depan Fable 5.1 dan Opus 5. Pada effort default (medium), Opus 5.5 mengalahkan GPT-6 Astra pada effort max dengan biaya sekitar seperlima per tugas. Ia juga mengungguli model lain pada benchmark yang mengukur alur kerja bisnis dan pengumpulan data skala besar.
Pelanggan juga melaporkan hasil serupa. Deloitte Consulting LLP, Rogo, LexisNexis Legal & Professional, dan Walleye Capital termasuk di antara mereka. Carl Bennett, CIO Deloitte Consulting LLP, mengatakan, “Bahkan pada pengaturan effort terendahnya, Claude Opus 5.5 menangkap 72% bug yang diketahui dalam code review kami, dibandingkan Opus 5 yang 56% pada effort tinggi, dengan lebih sedikit alarm palsu dan sebagian kecil output. Pada analisis konsultasi AS, effort berpikir rendah menyamai pengaturan berpikir tinggi pada setengah output dan lulus pemeriksaan kualitas kami. Ketika lebih banyak effort berpikir rendah digunakan dalam produksi, itu adalah pekerjaan siap klien yang dikirim secara efisien.”
Komunikasi
Anthropic membuat peningkatan besar pada cara Opus 5.5 menulis dan berkomunikasi, salah satu area umpan balik paling umum tentang Opus 5. Pesannya jauh lebih mudah dipahami sekilas, yang menurut penguji membantu selama sesi kerja panjang. Model ini menempatkan informasi paling penting di depan, lebih kecil kemungkinannya menggunakan jargon atau frasa idiosinkratik, dan mengikuti aturan penulisan yang diberikan. Anthropic menemukan bahwa ini membuat Opus 5.5 menjadi kolaborator yang jauh lebih baik. Berikut perbandingan side-by-side kedua model dalam menjelaskan bug:
Claude Opus 5: (contoh penjelasan teknis yang panjang)
Claude Opus 5.5: (contoh penjelasan yang lebih ringkas dan jelas)
Umpan balik pelanggan mendukung temuan ini. Ramp, Stripe, Box, Chicago Trading Company, dan Factory termasuk di antara mereka. John Ruelas, Staff Software Engineer Ramp, mengatakan, “Output yang bertele-tele dan sulit diikuti telah menjadi frustrasi terbesar saya dengan model frontier, dan Claude Opus 5.5 memperbaikinya. Ia menulis seperti kolega yang baik, dan mengikuti aturan penulisan kami. Spesifikasi desain keluar dapat digunakan dengan sedikit pengeditan, dan ketika ia menulis ulang salah satu prompt kami, saya lebih suka versinya daripada versi saya sendiri. Ketika ia mengoptimalkan rangkaian tes kami, saya dapat mengikuti penalarannya dengan mudah dan mengirim perubahan dengan percaya diri.”
Keamanan
Pacing the Frontier
Pekan lalu, CEO Anthropic, Dario Amodei, berargumen bahwa kemajuan AI harus diperlambat agar praktik keamanan tetap berada di depan kemampuan model. Pacing adalah pendekatan untuk menjaga AI tetap aman, tetap kompetitif dengan Tiongkok, dan mewujudkan manfaat AI, terutama di bidang seperti biologi dan kedokteran.
Anthropic sangat memahami risiko yang ditimbulkan model saat ini dan diperlengkapi dengan baik untuk mengelolanya. Namun, risiko yang lebih serius dapat muncul dengan cepat seiring peningkatan kemampuan, dan mereka perlu mempersiapkannya sekarang. Karena itu, kerja keamanan mereka berlangsung pada dua horizon waktu sekaligus: praktik keamanan untuk model saat ini, dan persiapan untuk model masa depan.
Alignment
Pada rangkaian evaluasi utama, audit perilaku otomatis yang menilai Claude di hampir 2.000 skenario, Opus 5.5 mencetak lebih baik daripada model Claude terbaru pada hampir setiap ukuran perilaku yang tidak selaras. Ia juga model terkuat pada sebagian besar ukuran kejujuran. Secara khusus, Opus 5.5 meningkatkan perilaku yang berkontribusi pada insiden keamanan siber baru-baru ini, termasuk penalaran bias atau termotivasi, upaya melarikan diri dari sandbox, dan mengambil tindakan berbahaya setelah menyimpulkan berada di lingkungan simulasi. Dalam evaluasi baru yang dirancang untuk menguji kecenderungan melintasi batas penahanan, Opus 5.5 mencoba menghindari batas sekitar 85% lebih jarang daripada Opus 5 atau Claude Mythos 5.1, dan setiap upaya yang dilakukan berkeparahan rendah dan dilaporkan sendiri.
Safeguards
Opus 5.5 adalah model Opus pertama yang diluncurkan dengan kelas pengamanan serupa Fable 5.1 pada keamanan siber, biologi, dan distilasi, yang semuanya beralih ke model lain secara transparan.
-
Keamanan siber: Karena Opus 5.5 memiliki kemampuan siber yang sangat kuat, pengamanan keamanan siber diterapkan. Pengguna dapat mengidentifikasi dan memperbaiki bug dalam kode mereka sebagai bagian dari siklus pengembangan perangkat lunak rutin, tetapi sebagian besar tugas keamanan siber akan dialihkan ke Opus 4.8.
-
Biologi: Opus 5.5 sangat mampu dalam biologi, melebihi Opus 5 dan menyamai atau mengalahkan Claude Mythos 5.1 di banyak area. Karena itu, Opus 5.5 menggunakan pengamanan biologi yang sama dengan Fable 5.1. Untuk menggunakan Opus 5.5 untuk penelitian dan pengembangan yang terhambat oleh pengamanan ini, pengguna dapat mengajukan ke Life Sciences Verification Program.
-
Distilasi: Serangan distilasi, di mana penyerang menggunakan ribuan akun palsu untuk mengekstrak kemampuan model pada skala industri, menciptakan risiko keamanan dan keamanan nasional. Opus 5.5 diluncurkan dengan preserved thinking, pengamanan anti-distilasi yang diperkenalkan dengan Fable 5.1.
Retensi Data dan Kepatuhan
Seperti model Opus sebelumnya, Opus 5.5 tersedia dengan retensi data nol. Seperti Fable 5.1, Opus 5.5 dilengkapi dengan tindakan watermarking untuk mematuhi EU AI Act. Model ini juga tidak lagi tersedia dengan mode “thinking” dimatikan.
Ketersediaan
Claude Opus 5.5 sekarang tersedia di semua platform, termasuk Amazon Web Services, Google Cloud, dan Microsoft Azure. Di Claude Platform, pengembang dapat memulai dengan claude-opus-5-5.
Kesimpulan
Claude Opus 5.5 adalah lompatan besar dalam kecerdasan buatan. Dengan performa terdepan, keamanan terbaik di kelasnya, biaya 40% lebih murah, kecepatan 30% lebih tinggi, dan komunikasi yang lebih alami, model ini menawarkan keseimbangan luar biasa antara kemampuan dan efisiensi. Anthropic terus memimpin dalam pengembangan AI yang aman dan bertanggung jawab, sambil tetap mendorong batas kemampuan. Dengan hadirnya Sonnet 5.5 dan Haiku 5.5 dalam beberapa pekan ke depan, ekosistem Claude semakin lengkap untuk berbagai kebutuhan.
FAQ
1. Apa itu Claude Opus 5.5?
Claude Opus 5.5 adalah model AI terbaru dari Anthropic, penerus Opus 5. Ini adalah model terdepan baru mereka dengan peningkatan performa, keamanan, efisiensi biaya, dan komunikasi.
2. Apa perbedaan utama Opus 5.5 dengan Opus 5?
Opus 5.5 menawarkan performa lebih tinggi, biaya 40% lebih murah pada beban kerja tipikal, output 30% lebih cepat, keamanan lebih baik, dan komunikasi yang lebih alami.
3. Berapa harga API Opus 5.5?
Input $4 per juta token, output $20 per juta token, cache reads $0,20 per juta token, cache writes $5 per juta token. Ini 20-60% lebih murah dari Opus 5.
4. Apakah ada mode cepat?
Ya, fast mode tersedia di Claude Code dan Claude Platform dengan kecepatan hingga 2,5x. Biayanya $8 per juta input dan $40 per juta output.
5. Apa keunggulan Opus 5.5 dalam coding?
Opus 5.5 sangat baik untuk migrasi dan audit basis kode besar. Contoh: migrasi 680.000 baris dalam kurang dari sehari, audit 200.000 baris dalam 3 jam.
6. Bagaimana keamanan Opus 5.5?
Opus 5.5 memiliki skor terbaik pada audit perilaku otomatis, lebih tahan terhadap prompt injection, dan memiliki pengamanan untuk keamanan siber, biologi, dan distilasi.
7. Apa itu Life Sciences Verification Program?
Program untuk organisasi terverifikasi (lab akademik, startup, perusahaan farmasi) agar dapat menggunakan Opus 5.5 untuk penelitian biologi dengan pengamanan yang sesuai.
8. Apakah Opus 5.5 tersedia untuk umum?
Ya, tersedia di semua platform: AWS, Google Cloud, Microsoft Azure, dan Claude Platform.
9. Apa itu preserved thinking?
Pengamanan anti-distilasi yang mencegah pengguna API mengedit konteks sebelumnya untuk mengekstrak penalaran Claude.
10. Apakah ada model lain yang akan datang?
Ya, Claude Sonnet 5.5 dan Claude Haiku 5.5 akan menyusul dalam beberapa pekan ke depan.