The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation
This paper explores how to improve long-horizon planning in AI agents, which is crucial for foundation models. Practitioners might care because better planning abilities can lead to more effective and efficient decision-making in complex environments.