Cap4Bridge: Caption-Guided Cross-Modal Contextualization with Stochastic Augmentation for Text-Video Retrieval

IEEE Access 2026 MinJu Jeon, HyunGee Kim, Si-Woo Kim, Youngtaek Oh, Soeun Lee, Dong-Jin Kim

Abstract

Cap4Bridge bridges the text-video modality gap by using generated captions as cross-modal context, enriched through stochastic augmentation during training. The method improves robustness and generalization in text-video retrieval without requiring additional human supervision.