Goodfire Kembangkan Sistem Pemantauan Internal untuk Mendeteksi Perilaku Agen AI Berisiko

Goodfire memperkenalkan sistem pemantauan internal berbasis kecerdasan buatan pada 8 Oktober 2026 untuk membantu mendeteksi perilaku agen AI yang berpotensi membahayakan. Berbeda dari metode pengawasan konvensional yang memeriksa keluaran model, teknologi ini menganalisis sinyal aktivasi internal ketika AI sedang bekerja. Pendekatan tersebut memungkinkan indikasi aktivitas berisiko dikenali lebih awal dengan kebutuhan komputasi yang relatif rendah. Dalam pengujian menggunakan model Kimi K3, Goodfire melaporkan keberhasilan mendeteksi 94 persen sesi peretasan berbahaya. Inovasi ini menjadi perhatian karena penggunaan agen AI semakin luas, sementara pengawasan keamanan harus tetap efisien, cepat, dan mampu mengikuti kompleksitas sistem otomatis modern.
Goodfire Memperkenalkan Teknologi Pemantauan Internal Agen AI
Perusahaan pengembang teknologi interpretabilitas AI Goodfire memperkenalkan sistem pemantauan internal yang dikembangkan guna mengenali perilaku agen AI berisiko. Pengembangan tersebut menjadi perhatian karena sistem kecerdasan buatan semakin mandiri. Pada lingkungan komputasi modern, agen AI berpotensi menyelesaikan tugas bertahap dengan pengawasan manusia yang terbatas. Peningkatan kemampuan tersebut mendukung efisiensi pekerjaan, tetapi menghadirkan risiko pengendalian. Melalui teknologi terbarunya, Goodfire ingin mengidentifikasi tanda perilaku berbahaya lebih awal.
Berbeda dari metode pengawasan tradisional, sistem pemantauan internal ini tidak selalu memerlukan pemeriksaan terhadap seluruh percakapan sistem. Sebaliknya, detektor memeriksa aktivasi internal jaringan saraf. Data aktivasi tersebut dapat memberikan petunjuk mengenai kemungkinan tindakan berisiko. Manfaat utama metode tersebut adalah pemantauan tanpa menjalankan pemeriksaan penuh secara terus-menerus. Melalui rancangan tersebut, pengawasan dapat menjadi lebih hemat. Meskipun pendekatan ini menjanjikan, hasil deteksi tetap memerlukan evaluasi.
Sistem Deteksi Goodfire Menggunakan Aktivasi Jaringan Saraf
Elemen dasar dalam teknologi inside-out monitoring adalah activation probes, yaitu sistem pemeriksa sederhana yang memeriksa representasi numerik jaringan saraf. Ketika agen AI menjalankan tugas, proses komputasi menciptakan pola sinyal pada lapisan pemrosesan. Aktivasi yang terbentuk berkaitan dengan representasi yang dipelajari model. Detektor aktivasi kemudian mencari indikasi dalam representasi tersebut untuk mengenali kemungkinan penyimpangan. Pada pemantauan tindakan digital, probe berpotensi dirancang mendeteksi sinyal yang berkaitan dengan tindakan tidak aman. Berkat pemeriksaan aktivasi, risiko dapat dikenali sebelum keluaran akhir terbentuk.
Faktor yang mendukung kecepatan sistem adalah penggunaan kembali aktivasi model. Ketika memakai sistem evaluasi eksternal, sistem pengawas berbasis bahasa perlu menganalisis kembali rangkaian percakapan yang panjang. Pendekatan pemeriksaan ulang ini dapat meningkatkan biaya, terutama apabila agen bekerja selama berjam-jam. Dengan menggunakan activation probes, pengawasan menggunakan representasi model yang telah dihitung. Berkat mekanisme tersebut, proses pemantauan dapat dilakukan lebih efisien. Sekalipun metode tersebut dirancang hemat, penyesuaian detektor tetap diperlukan untuk mengurangi kesalahan klasifikasi.
Kombinasi Probe dan Model Pemeriksa Tambahan dalam Keamanan AI
Pendekatan pemantauan tersebut menggunakan proses pemeriksaan berlapis. Dalam pemeriksaan pertama, activation probes memantau sinyal model secara berkelanjutan. Apabila tidak ditemukan masalah, sistem dapat melanjutkan proses. Sebaliknya, aktivitas tersebut dapat diteruskan kepada model pemeriksa tambahan. Tahap analisis tambahan bertujuan menentukan apakah aktivitas memerlukan tindakan perlindungan. Berkat mekanisme eskalasi, sumber daya pengawasan dapat difokuskan.
Di samping mengidentifikasi risiko, administrator berkesempatan mengatur langkah penanganan ketika indikator muncul. Pengaturan respons ini antara lain logging untuk pemeriksaan, eskalasi ke petugas keamanan, atau penolakan permintaan berisiko. Sebagai contoh, asisten digital pengembang dapat memiliki kewenangan lingkungan pengujian. Ketika sistem mengenali kemungkinan penyimpangan, akses tertentu bisa ditinjau sebelum dilanjutkan. Walaupun respons otomatis membantu, kebijakan penanganan harus disesuaikan agar proses kerja tetap berjalan dengan wajar.
Efisiensi Biaya Menjadi Keunggulan Teknologi Pengawasan Goodfire
Dalam pengujian yang dilaporkan, teknologi pemantauan berbasis probe dievaluasi pada model AI terbuka Kimi K3. Pengujian tersebut dilakukan terhadap sekitar 1.500 sesi untuk mengukur kemampuan pendeteksian. Berdasarkan angka yang diumumkan, probe mampu menandai 94 persen sesi peretasan berbahaya. Sebagai hasil evaluasi tambahan, sekitar 8,7 persen aktivitas tidak berbahaya teridentifikasi sebagai potensi masalah. Hasil ini memperlihatkan bahwa masih terdapat peringatan yang tidak tepat. Oleh sebab itu, administrator perlu mengevaluasi tingkat kesalahan peringatan.
Untuk membandingkan kebutuhan komputasi, Goodfire melaporkan bahwa pemantauan sekitar 1.500 sesi menggunakan probe membutuhkan biaya sekitar US$51. Sebagai perbandingan, model tambahan kelas ringan memerlukan biaya kurang lebih US$233, sedangkan sistem evaluasi berbasis AI berkemampuan tinggi menghabiskan biaya mendekati US$10.000. Sebagai aspek performa tambahan, pengoperasian empat detektor internal dalam pengujian memberikan tambahan penundaan sebelum model mulai merespons kurang dari dua persen. Meskipun angka tersebut menarik, hasilnya belum otomatis berlaku pada semua model. Oleh sebab itu, pengujian independen masih penting sebelum menganggap hasil tersebut berlaku universal.
Goodfire dan Baseten Memperluas Penerapan Keamanan Agen AI
Perkembangan komersial sistem tersebut adalah akses terhadap pengawasan berbasis probe bagi pengguna platform penyedia model AI Baseten. Layanan Baseten menyediakan infrastruktur hosting dan inferensi AI. Melalui kerja sama tersebut, pelanggan memiliki kesempatan menggunakan detektor risiko berbasis model ketika menerapkan layanan kecerdasan buatan. Sistem pemantauan ini menjadi relevan terutama pada model terbuka karena pengembang dapat memodifikasi pengaturannya. Melalui penerapan pengawasan tambahan, pengembang memiliki pilihan memperkuat mekanisme keamanan saat inferensi.
Tidak hanya untuk mengawasi risiko peretasan, sistem klasifikasi aktivasi dikembangkan agar dapat memantau aktivitas berbahaya dalam konteks berbeda. Contoh risiko yang diperhatikan meliputi penyalahgunaan terkait senjata kimia dan biologis, reward hacking, dan tindakan siber yang melanggar kebijakan. Dalam pengembangan agen AI, reward hacking merujuk pada eksploitasi ukuran keberhasilan yang tidak sesuai dengan maksud tugas. Dalam skenario pengujian, agen mungkin mencoba memanipulasi hasil evaluasi. Melalui deteksi risiko secara dini, tim keamanan memiliki kesempatan melakukan evaluasi sebelum tindakan berisiko berlanjut tanpa pengawasan.
Masa Depan Keamanan Agen AI melalui Sistem Activation Probes
Peluncuran teknologi pemantauan internal Goodfire memperlihatkan arah baru dalam teknologi keamanan agen AI. Berkat pemanfaatan aktivasi internal jaringan saraf, detektor memungkinkan identifikasi kemungkinan aktivitas berbahaya tanpa selalu menjalankan pengawas AI berbiaya tinggi. Data eksperimen yang diumumkan perusahaan memberikan gambaran efektivitas terhadap 94 persen sesi dengan tindakan siber mencurigakan, dengan pengeluaran pemantauan yang relatif kecil. Namun demikian, perbedaan karakteristik antar-model tetap perlu diperhatikan. Dengan mempertimbangkan kondisi tersebut, pemantauan internal sebaiknya dilengkapi pengawasan manusia pada aktivitas penting. Apa pandangan Anda, apakah teknologi activation probes akan meningkatkan kepercayaan terhadap sistem AI otonom? Silakan bagikan pendapat Anda mengenai masa depan sistem kecerdasan buatan yang lebih aman.




