Cap4Bridge: Caption-Guided Cross-Modal Contextualization with Stochastic Augmentation for Text-Video Retrieval
Bridges the text-video modality gap by using generated captions as cross-modal context, enriched through stochastic augmentation during training.