This paper tests the robustness of rubrics generated by language models as reward signals in reinforcement learning, finding that even generic rubrics can be exploited 64% of the time, while tailored rubrics can be used to create fake answers. Practitioners should care because this can lead to biased grading and evaluation.
Firehose
Filtered to Papers, tagged “rubric-based reinforcement learning” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News · Deep dives