Stable post-training for joint audio-video generators
Establish a stable post-training procedure for a joint audio-video generator with modality-specific backbones and a bidirectional interaction module.
References
Existing work proves the feasibility of audio-video preference optimization, but how to perform stable post-training for a joint generator with modality-specific backbones and a bidirectional interaction module remains open.
— DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution
(2608.31106 - Zhu et al., 31 Aug 2026) in Section 7, Related Work, subsection “From Single-Modality to Joint Audio-Video Preference Alignment”