A CNN-transformer multimodal architecture for weakly-supervised audio-visual violence detection
Crossref DOI link: https://doi.org/10.53022/oarjet.2026.11.1.0056
Published Online: 2026-07-31
Update policy: https://doi.org/10.53022/oarj.ourcrossmarkpolicy
Gyawali, Rahul
Dhakal, Rabin
Dulal, Deepak
Thapa, Mandip
Khanal, Sardul