Skip to yearly menu bar Skip to main content


Poster
in
Workshop: 3rd AI for Math Workshop: Toward Self-Evolving Scientific Agents
Sat, Jul 11, 2026 • 11:05 AM – 12:05 PM KST

EMA Policy Gradient: Taming Reinforcement Learning for LLMs with EMA Anchor and Top-k KL

Lunjun Zhang ⋅ Jimmy Ba

Abstract

Chat is not available.