RoNE: Robust Neurons Enable Internal Defenses Against Multimodal Jailbreak
TL Tran, H Phan, C Kanan, T Le

Jailbreak defense, adversarial robustness, and internal safeguards for LLMs and multimodal models.
To protect foundation models against adversarial manipulation, jailbreaks, and misuse through principled internal and external defenses.
This research focuses on the security of large language and multimodal foundation models. Work includes internal neuron-level defenses against jailbreaks, adversarial robustness, and threat detection in AI systems.
Paper ... accepted at ...
TL Tran, H Phan, C Kanan, T Le
D Nguyen, TAH Nguyen, TD Le, S Venkatesh, T Le, S Gupta
VH Tran, VL Ngo, D Nguyen, T Nguyen, P Nguyen, M Harandi, T Le
J Dhar, MK Pandey, B Bozorgtabar, T Le, L Yao
Jingmin Zhu, Rollin Omari, Tamas Abraham, Junae Kim, Amardeep Kaur, Trung Le, Dinh Phung, Qiuhong Ke