Skip to yearly menu bar Skip to main content


Poster
in
Workshop: RLxF: RL from World Feedback
Fri, Jul 10, 2026 • 4:00 PM – 5:00 PM KST

Coherent Off-Policy Improvement of Large Behaviour Models with Learned Rewards

Christian Scherer ⋅ Joe Watson ⋅ Daniel Palenicek ⋅ Theo Gruner ⋅ Ingmar Posner ⋅ Jan Peters

Abstract

Chat is not available.