Privacy leakage and private-information extraction in reinforcement-learning split learning
Determine how to formally define the privacy leakage of reward models in reinforcement-learning-based split learning and how an adversary could effectively extract private information from those reward models.
References
Moreover, unlike supervised learning, reinforcement learning does not rely on explicit token-level labels. In RL-based SL, it remains an open question how to formally define the privacy leakage of reward models, as well as how an adversary could effectively extract private information from reward models.
— Gradient Mirage: Trainable yet Label-Unidentifiable Gradients in Large Language Model Split Learning
(2608.18767 - Miao et al., 19 Aug 2026) in Appendix, Section Future Work