Skip to yearly menu bar Skip to main content


Poster
in
Workshop: Trustworthy AI for Good Workshop

Safety-Anchored Fine-Tuning: Diagnosing and Preventing Safety Collapse in Large Language Models via Adversarial Alignment Anchoring

Mohammad Kadiri ⋅ Kush Shriram Patil

Abstract

Chat is not available.