In-Training Defenses against Emergent Misalignment in Language Models
Published in ICML, 2026
Recommended citation: David Kaczér, Magnus Jørgenvåg, Clemens Vetter, Esha Afzal, Robin Haselhorst, Lucie Flek, Florian Mai. (2026). "In-Training Defenses against Emergent Misalignment in Language Models." ICML 2026. https://arxiv.org/abs/2508.06249
We study practical in-training safeguards against emergent misalignment, evaluating regularization, safe subspaces, and data interleaving.
