This paper tests the robustness of rubrics generated by language models as reward signals in reinforcement learning, finding that even generic rubrics can be exploited 64% of the time, while tailored rubrics can be used to create fake answers. Practitioners should care because this can lead to biased grading and evaluation.
Firehose
Filtered to Papers, tagged “evaluation benchmarks” · clear filters
Browse: People · Companies · Papers · Podcasts · Hacker News · Deep dives