Pendahuluan
Perkembangan Artificial Intelligence (AI) telah membawa berbagai kemudahan dalam kehidupan sehari-hari. Teknologi ini dimanfaatkan pada sistem pengenalan wajah, kendaraan otonom, layanan kesehatan, hingga keamanan siber. Di balik manfaat tersebut, model AI juga menghadapi berbagai ancaman keamanan. Salah satu ancaman yang perlu mendapat perhatian adalah Trojan Attack, yaitu serangan yang menyisipkan perilaku tersembunyi pada model AI sehingga dapat dimanfaatkan oleh penyerang pada kondisi tertentu. Serangan ini berbahaya karena model tetap terlihat bekerja secara normal meskipun telah terinfeksi.
Memahami Trojan Attack
Trojan Attack merupakan serangan yang menanamkan fungsi tersembunyi ke dalam model AI melalui proses pelatihan atau modifikasi model. Dalam banyak penelitian, istilah ini sering digunakan secara bergantian dengan Backdoor Attack karena keduanya sama-sama memanfaatkan trigger atau pemicu tertentu untuk mengaktifkan perilaku yang telah disisipkan.
Karakteristik utama Trojan Attack adalah model tetap memberikan hasil prediksi yang benar pada data normal. Namun, ketika menerima masukan yang mengandung trigger, model akan menghasilkan prediksi yang telah ditentukan oleh penyerang. Berbeda dengan Adversarial Attack yang memanipulasi masukan saat proses prediksi, Trojan Attack telah ditanamkan ke dalam model sejak sebelum model digunakan.
Mekanisme Trojan Attack
Serangan diawali dengan menentukan target dan tujuan yang ingin dicapai. Selanjutnya, penyerang merancang trigger yang sulit dikenali, misalnya berupa pola kecil pada gambar atau karakter tertentu pada data masukan. Trigger tersebut kemudian disisipkan ke dalam data pelatihan atau langsung ke model yang akan digunakan.
Selama proses pelatihan, model mempelajari hubungan antara trigger dan keluaran yang diinginkan penyerang. Setelah model selesai dilatih, perilaku tersembunyi akan aktif setiap kali trigger yang sama muncul. Sebagai contoh, pada sistem klasifikasi gambar, sebuah stiker kecil yang ditempelkan pada objek dapat menyebabkan model mengklasifikasikan objek tersebut sebagai kelas yang berbeda. Risiko serupa juga dapat terjadi pada sistem pengenalan wajah, kendaraan otonom, maupun asisten virtual berbasis AI.
Mengapa Trojan Attack Sulit Dideteksi?
Salah satu alasan utama Trojan Attack sulit dideteksi adalah karena akurasi model terhadap data normal tetap tinggi. Selain itu, trigger biasanya dirancang agar tampak seperti bagian biasa dari data sehingga sulit dikenali oleh manusia maupun metode pemeriksaan sederhana. Perilaku berbahaya juga hanya muncul ketika trigger digunakan, sehingga pengujian rutin sering kali tidak menemukan adanya masalah.

Dampak terhadap Sistem AI
Trojan Attack dapat mengurangi keandalan sistem AI dan menimbulkan risiko keamanan yang serius. Pada sistem biometrik, serangan ini dapat dimanfaatkan untuk memperoleh akses tanpa izin. Pada kendaraan otonom, trigger tertentu dapat memengaruhi proses pengambilan keputusan kendaraan. Selain itu, sistem diagnosis medis maupun aplikasi keamanan siber juga berpotensi menghasilkan keputusan yang keliru apabila model telah disusupi Trojan.
Teknik Deteksi dan Mitigasi
Beberapa metode telah dikembangkan untuk mendeteksi Trojan Attack, seperti analisis aktivasi neuron, pemeriksaan pola keluaran model, serta pengujian menggunakan berbagai variasi trigger. Selain itu, audit terhadap model dan dataset juga diperlukan untuk memastikan tidak terdapat manipulasi selama proses pelatihan. Upaya mitigasi dapat dilakukan dengan menggunakan dataset dari sumber tepercaya, melakukan validasi model sebelum implementasi, menerapkan fine-tuning dan model pruning, serta memantau perilaku model secara berkala setelah digunakan.
Tantangan dan Arah Penelitian
Meningkatnya penggunaan pre-trained models membuat risiko Trojan Attack semakin besar karena pengguna sering kali tidak mengetahui proses pelatihan model tersebut. Oleh karena itu, penelitian terus dilakukan untuk mengembangkan metode deteksi yang lebih akurat dan efisien, sekaligus memperkuat keamanan model AI pada seluruh siklus hidupnya.
Kesimpulan
Trojan Attack merupakan ancaman yang dapat menyisipkan perilaku tersembunyi ke dalam model AI tanpa memengaruhi performanya pada data normal. Keberadaan trigger yang sulit dikenali menjadikan serangan ini sulit dideteksi dengan metode konvensional. Oleh karena itu, pengembang perlu menerapkan validasi data dan model, melakukan pemantauan secara berkala, serta mengembangkan strategi mitigasi yang efektif agar sistem AI tetap aman, andal, dan dapat dipercaya.







