ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
A foundation vision-language model for Vietnamese image-text retrieval. It pairs CLIP-style contrastive learning with a Similarity-Graph Regularized Optimal Transport (SIGROT) loss to improve cross-modal consistency and reduce the modality gap.
CiteHide citationViCLIP-OT
@misc{tran2026viclipot,
title = {ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport},
author = {Tran, Quoc-Khang and Nguyen, Minh-Thien and Pham, Nguyen-Khang},
year = {2026},
eprint = {2602.22678},
archivePrefix = {arXiv},
primaryClass = {cs.CV},
url = {https://arxiv.org/abs/2602.22678}
}