Photo of MinJu Jeon

MinJu Jeon

LG AI Research · EXAONE Lab

AI Researcher · Multimodal & Language Models · Data-Centric Training

  • About
  • Publications
  • Projects
  • CV

Publications

Research on multimodal learning, language models, and data-centric AI.

Thumbnail for Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach
Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach
EMNLP 2026 (Findings, Long) MinJu Jeon, Younghan Park, Han Sung Park, Jong-Hwan Kim, Dong-Jin Kim, Hoyeon Lee
#Data-Centric #Multilingual Speech #Grapheme-to-Phoneme

A benchmark and taxonomy for phonemizing noisy user-generated text, paired with a compositional approach for irregular spellings, abbreviations, and code-mixing.

Thumbnail for Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
Follow the Saliency: Supervised Saliency for Retrieval-augmented Dense Video Captioning
CVPR 2026 Seunghee Choi, MinJu Jeon, Hyunwoo Oh, Jihwan Lee, Dong-Jin Kim
#Dense Video Captioning

A retrieval-augmented dense video captioning approach that injects supervised saliency signals into both the retrieval and generation stages.

Paper
Thumbnail for SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning
CVPR 2026 Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, MinJu Jeon, HyunGee Kim, Dong-Jin Kim
#Dense Video Captioning

Tackles weakly-supervised dense video captioning through similarity-aware guidance and inter-caption augmentation.

Paper
Thumbnail for Cap4Bridge: Caption-Guided Cross-Modal Contextualization with Stochastic Augmentation for Text-Video Retrieval
Cap4Bridge: Caption-Guided Cross-Modal Contextualization with Stochastic Augmentation for Text-Video Retrieval
IEEE Access 2026 MinJu Jeon, HyunGee Kim, Si-Woo Kim, Youngtaek Oh, Soeun Lee, Dong-Jin Kim
#Text-Video Retrieval #Data-Centric

Bridges the text-video modality gap by using generated captions as cross-modal context, enriched through stochastic augmentation during training.

Thumbnail for Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
Sali4Vid: Saliency-Aware Video Reweighting and Adaptive Caption Retrieval for Dense Video Captioning
EMNLP 2025 (Long, Main) MinJu Jeon, Si-Woo Kim, Ye-Chan Kim, HyunGee Kim, Dong-Jin Kim
#Dense Video Captioning #Data-Centric

A dense video captioning framework that reweights video frames by saliency and adaptively retrieves relevant captions at inference time.

Thumbnail for SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
SynC: Synthetic Image Caption Dataset Refinement with One-to-many Mapping for Zero-shot Image Captioning
ACM MM 2025 Si-Woo Kim, MinJu Jeon, Ye-Chan Kim, Soeun Lee, Taewhan Kim, Dong-Jin Kim
#Zero-shot Captioning #Data-Centric

Refines noisy synthetic image-caption datasets through a one-to-many mapping that re-aligns each image with its best-matching captions.

© 2026 MinJu Jeon.
Built with Academic Portfolio Astro