Reliable held-out modality-utility estimation under sample-level variation

Develop reliable methods for estimating modality utility from held-out discriminative performance in the presence of sample-level variation and cross-modal complementarity.

Background

The paper argues that optimization-based balancing methods use training losses, gradients, and likelihood ratios as proxies for modality contribution, even though these signals primarily measure fitting speed rather than test-time discriminative utility. The authors propose separating encoder optimization on training data from fusion-weight optimization based on held-out validation performance.

Because modality usefulness can vary across samples and because complementary information may emerge only through joint processing, the paper identifies the reliable estimation of modality utility from held-out discriminative performance as an unresolved research direction. This motivates sample-level modality valuation, discriminative meta-classification, robustness profiling, and validation-based fusion-weight optimization.

References

Optimization-based balancing conflates fitting with contributing. The empirical results in Section~3 and the controlled demonstrations in Section~4.2 suggest that estimating modality utility from held-out discriminative performance is a promising direction, and they raise open questions about how to do so reliably under sample-level variation and complementarity.

The Illusion of Balanced Multimodal Sentiment Analysis: Beyond the Limits of Optimization-Based Methods  (2609.11247 - Kaffeza et al., 10 Sep 2026) in Section 5, “A Discriminative Path Forward: Implication and Open Problems”