Valid and Comparable Evaluation Protocols Across Target Speaker Extraction Cues
Establish evaluation protocols that reveal target-selection failures and enable controlled comparisons across audio, visual, spatial, textual, and neural target speaker extraction cues without eliminating modality-specific requirements.
References
The open problem is not merely selecting more metrics, but establishing protocols that reveal target-selection failures and permit controlled comparisons without erasing modality-specific requirements.
— Multimodal Target Speaker Extraction: Towards Unified Speaker Cues Across Modalities
(2609.35613 - Qian et al., 28 Sep 2026) in Section 7.6, “Evaluation Validity and Application Dependence”