Skip to yearly menu bar Skip to main content


EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

Lunjun Zhang ⋅ Jimmy Ba

Abstract

Chat is not available.