Toggle Poster Visibility
Oral
Tue Jul 07 06:00 PM -- 06:15 PM (PDT) @ HALL B2 None
Mitigating Reward Hacking in RLHF via Bayesian Non-negative Reward Modeling
[
OpenReview]
Oral
Tue Jul 07 06:15 PM -- 06:30 PM (PDT) @ HALL B2 None
DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research
[
OpenReview]
Oral
Tue Jul 07 06:30 PM -- 06:45 PM (PDT) @ HALL B2 None
Simultaneous Speech-to-Speech Translation Without Aligned Data
[
OpenReview]
Oral
Tue Jul 07 06:45 PM -- 07:00 PM (PDT) @ HALL B2 None
Video-Based Optimal Transport for Feedback-Efficient Offline Preference-Based Reinforcement Learning
[
OpenReview]
Successful Page Load