Papers

Filtered to exploration · clear filter

Browse by term

continual learning 64reinforcement learning 34large language models 17benchmarking 12vision-language models 10generative models 8language models 8video generation 7multimodal models 6natural language processing 6robotics 6world models 6benchmarks 5diffusion models 5on-policy distillation 5policy optimization 5scalability 5self-distillation 5vision-language-action models 5autoregressive models 4computer vision 4diffusion transformers 4LLMs 4multimodal large language models 4verifiable rewards 4attention mechanisms 3embodied intelligence 3image editing 3long-term memory 3multimodal learning 3

Matching papers

Enhancing Rubric-based RL via Self-Distillation

15 upvotes · 21 JUL 2026 · Mingxuan Xia, Yuhang Yang, Chao Ye et al.

This paper improves a type of reinforcement learning (RL) called rubric-based RL, which helps large language models (LLMs) perform well on open-ended tasks. A practitioner might care about this paper because it addresses a common problem in RL, where some criteria (or rules) are not explored properly, and it shows that its new method can improve performance on these tasks.