Subjective Quality Evaluation of Text-to-Music Generation
Establish reliable methodologies for evaluating the subjective quality of text-to-music generation models, including both acoustic quality and musical quality, that accurately reflect human judgments.
References
Although objective performance metrics exist, evaluating the subjective quality of these models remains an open research question.
— PAM: Prompting Audio-Language Models for Audio Quality Assessment
(2402.00282 - Deshmukh et al., 2024) in Section 5.2 (Text-to-Music generation)
Further, capturing relative quality across a broader candidate pool and reducing dependence on large-scale preference datasets remain open challenges, as existing approaches rely on pairwise comparisons or fixed datasets.
— VIBE: Video Instruction-aligned Background music gEneration
(2608.30125 - Bhosale et al., 31 Aug 2026) in Section 2, Related Work, subsection “Video-to-Music Generation”