Scaling DARS annotators and policies
Determine whether larger annotators improve supervision quality for Dependency-Aware Reward Shaping and whether larger policies benefit similarly from Dependency-Aware Reward Shaping.
References
First, we do not systematically explore scaling: whether larger annotators improve supervision quality or larger policies benefit similarly from DARS remains an open question.
— Dependency-Aware Reward Shaping for Agentic Reinforcement Learning
(2610.01207 - Chen et al., 1 Oct 2026) in Section 6, Conclusion and Limitations