Integrating Prefix Reuse with Predictive Multi-Tier KV Caching
Integrate prefix reuse into Predictive Multi-Tier Cache Optimization (PMCO) and quantify its prefill benefits and memory costs, including the compatibility requirements for reused compressed prefixes.
References
Integrating prefix reuse and quantifying its prefill benefits and memory costs remain open problems.
— TierKV: Long-Context On-Device LLMs via Predictive Multi-Tier KV Caching
(2609.21172 - Shu et al., 18 Sep 2026) in Section Discussion and Future Work, subsection “Prefix Caching”