Goodfire Kembangkan Sistem Pemantauan Internal untuk Mendeteksi Perilaku Agen AI Berisiko

Goodfire memperkenalkan sistem pemantauan internal berbasis kecerdasan buatan pada 8 Oktober 2026 untuk membantu mendeteksi perilaku agen AI yang berpotensi membahayakan. Berbeda dari metode pengawasan konvensional yang memeriksa keluaran model, teknologi ini menganalisis sinyal aktivasi internal ketika AI sedang bekerja. Pendekatan tersebut memungkinkan indikasi aktivitas berisiko dikenali lebih awal dengan kebutuhan komputasi yang relatif rendah. Dalam pengujian menggunakan model Kimi K3, Goodfire melaporkan keberhasilan mendeteksi 94 persen sesi peretasan berbahaya. Inovasi ini menjadi perhatian karena penggunaan agen AI semakin luas, sementara pengawasan keamanan harus tetap efisien, cepat, dan mampu mengikuti kompleksitas sistem otomatis modern.
Inovasi Goodfire untuk Meningkatkan Keamanan Sistem Kecerdasan Buatan
Perusahaan riset keamanan AI Goodfire menghadirkan pendekatan inside-out monitoring yang dikembangkan guna mengenali potensi penyimpangan tindakan sistem otomatis. Inovasi terbaru ini memiliki relevansi penting karena kemampuan agen AI terus meningkat. Ketika digunakan untuk menjalankan pekerjaan, agen AI mampu menjalankan sejumlah tindakan digital dengan pengawasan manusia yang terbatas. Perkembangan ini mendukung efisiensi pekerjaan, tetapi juga menimbulkan tantangan keamanan. Melalui teknologi terbarunya, Goodfire berupaya mengenali aktivitas mencurigakan sebelum tindakan terjadi.
Tidak seperti pendekatan pemeriksaan keluaran, pendekatan yang dikembangkan perusahaan tidak hanya membaca seluruh percakapan sistem. Sebagai alternatif, detektor memeriksa aktivasi internal jaringan saraf. Informasi tersebut dapat memberikan petunjuk mengenai kemungkinan tindakan berisiko. Nilai tambah teknologi tersebut adalah penggunaan kembali proses perhitungan model. Melalui rancangan tersebut, biaya pemantauan berpotensi berkurang. Meskipun pendekatan ini menjanjikan, kemampuan sistem perlu diuji pada berbagai kondisi.
Cara Kerja Activation Probes dalam Memantau Perilaku Agen AI
Komponen utama dalam sistem pemantauan Goodfire adalah activation probes, yaitu detektor berukuran kecil yang memeriksa pola komputasi selama pemrosesan. Saat model memproses instruksi, model menghasilkan berbagai aktivasi internal. Sinyal tersebut dapat mencerminkan proses pengolahan informasi. Detektor aktivasi kemudian memeriksa pola tertentu untuk mengidentifikasi perilaku mencurigakan. Sebagai contoh, sistem klasifikasi dapat digunakan mengidentifikasi pola penyalahgunaan kemampuan siber. Melalui mekanisme tersebut, risiko dapat dikenali sebelum keluaran akhir terbentuk.
Keunggulan teknis pendekatan tersebut adalah penggunaan kembali aktivasi model. Ketika memakai sistem evaluasi eksternal, sebuah model AI lain sering harus membaca ulang riwayat tindakan model. Pendekatan pemeriksaan ulang ini berpotensi menambah waktu pemrosesan, terutama apabila agen bekerja selama berjam-jam. Melalui pendekatan Goodfire, detektor cukup memanfaatkan representasi model yang telah dihitung. Oleh karena itu, beban pengawasan dapat dikurangi. Meskipun konsumsi sumber daya relatif kecil, pemilihan sinyal internal perlu diperhatikan untuk memastikan pengawasan sesuai risiko.
Mekanisme Eskalasi Goodfire untuk Menangani Risiko Agen AI
Pendekatan pemantauan tersebut menggunakan rangkaian evaluasi berdasarkan tingkat risiko. Ketika agen sedang bekerja, detektor internal memeriksa representasi internal selama pemrosesan. Apabila tidak ditemukan masalah, agen berpotensi tetap menjalankan tugas. Ketika probe menemukan sinyal berisiko, sistem berpotensi melakukan eskalasi kepada sistem peninjauan lanjutan. Pemeriksaan kedua bertujuan menentukan apakah aktivitas memerlukan tindakan perlindungan. Dengan pendekatan ini, sumber daya pengawasan dapat difokuskan.
Selain melakukan deteksi, penyedia layanan memiliki pilihan menetapkan respons terhadap peringatan. Pengaturan respons ini dapat mencakup logging untuk pemeriksaan, pengiriman kasus kepada manusia, atau penolakan permintaan berisiko. Sebagai contoh, agen pemrograman dapat memiliki kewenangan berbagai layanan perangkat lunak. Jika terdapat indikasi tindakan tidak sah, pengawasan dapat memicu tindakan pencegahan. Walaupun respons otomatis membantu, pengelola harus mempertimbangkan risiko kesalahan agar pengguna tidak terlalu banyak menerima peringatan palsu.
Pengujian Goodfire pada Kimi K3 Menunjukkan Kemampuan Deteksi Tinggi
Dalam pengujian yang dilaporkan, teknologi pemantauan berbasis probe diuji menggunakan model AI terbuka Kimi K3. Evaluasi teknis ini dilakukan terhadap sekitar 1.500 sesi untuk memeriksa kinerja detektor. Mengacu pada hasil yang dipublikasikan, sistem berhasil mendeteksi 94 persen sesi dengan tindakan siber berbahaya. Sebagai hasil evaluasi tambahan, sekitar 8,7 persen aktivitas normal ikut ditandai. Hasil ini menggambarkan kemungkinan peringatan yang tidak tepat. Karena kondisi tersebut, pengembang harus mempertimbangkan kemampuan menemukan ancaman.
Untuk membandingkan kebutuhan komputasi, Goodfire mengumumkan bahwa evaluasi sejumlah 1.500 sesi model menggunakan probe membutuhkan biaya sekitar US$51. Jika menggunakan pendekatan lain, model tambahan kelas ringan memerlukan biaya kurang lebih US$233, sedangkan model pemeriksa kelas atas dapat mencapai US$10.000. Sebagai aspek performa tambahan, pengoperasian empat detektor internal dilaporkan menambah latensi waktu menuju respons pertama kurang dari 2 persen. Meskipun angka tersebut menarik, performa dapat berbeda pada lingkungan lain. Oleh sebab itu, validasi tambahan sebaiknya dilakukan sebelum menganggap hasil tersebut berlaku universal.
Goodfire dan Baseten Memperluas Penerapan Keamanan Agen AI
Bagian penting dari peluncuran adalah akses terhadap pengawasan berbasis probe bagi pelanggan Baseten. Baseten merupakan layanan komputasi bagi penerapan model AI. Melalui kerja sama tersebut, pelanggan memiliki kesempatan menggunakan sistem perlindungan tambahan ketika menerapkan layanan kecerdasan buatan. Sistem pemantauan ini memiliki manfaat potensial terutama pada model terbuka karena pengembang dapat memodifikasi pengaturannya. Berkat dukungan pemantauan berlapis, pengembang memiliki pilihan memperkuat perlindungan terhadap tindakan agen.
Selain pemantauan keamanan siber, pendekatan interpretabilitas model dikembangkan agar dapat memantau beragam pola penyalahgunaan. Bidang pengawasan yang dapat dipilih meliputi aktivitas berbahaya berkaitan dengan CBRN, upaya mengeksploitasi mekanisme evaluasi, dan penyalahgunaan kemampuan keamanan komputer. Ketika sistem kecerdasan buatan menjalankan tugas, reward hacking terjadi ketika model mencari cara memenuhi penilaian tanpa menyelesaikan tujuan sebenarnya. Sebagai contoh, sistem berpotensi mencari jalan pintas yang tidak diinginkan. Berkat pemantauan perilaku internal, pengembang dapat memperoleh peringatan sebelum tindakan berisiko berlanjut tanpa pengawasan.
Peran Interpretabilitas dalam Mengurangi Risiko Kecerdasan Buatan
Pengembangan pendekatan pengawasan berbasis activation probes menjadi perkembangan penting dalam teknologi interpretabilitas kecerdasan buatan. Melalui pemeriksaan representasi numerik selama pemrosesan, teknologi tersebut dirancang mengenali indikasi perilaku berisiko tanpa harus memeriksa seluruh keluaran menggunakan model besar. Evaluasi menggunakan Kimi K3 menunjukkan kemampuan mendeteksi 94 persen sesi dengan tindakan siber mencurigakan, dengan pengeluaran pemantauan yang relatif kecil. Walaupun perkembangan ini menarik, kebutuhan pengujian independen tetap harus dipertimbangkan. Sebagai langkah penggunaan yang bertanggung jawab, pemantauan internal sebaiknya dilengkapi pembatasan izin agen. Menurut Anda, apakah sistem pemantauan internal Goodfire akan menjadi standar keamanan agen AI masa depan? Jangan ragu menyampaikan pandangan mengenai perkembangan teknologi keamanan AI.




