Skip to yearly menu bar Skip to main content


Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models

wenlong deng ⋅ Jiaji Huang ⋅ Kaan Ozkara ⋅ Yushu Li ⋅ Christos Thrampoulidis ⋅ Xiaoxiao Li ⋅ Youngsuk Park

Abstract

Chat is not available.