illuin-tech/colpali
A library for training and running visual document retrievers using Vision Language Models based on ColBERT-style multi-vector embeddings.

This repository implements ColPali and related ColVision models for document retrieval. It leverages Vision Language Models like PaliGemma to create multi-vector embeddings directly in the visual space, avoiding the need for OCR or text extraction. The models support training and inference for efficient visual document retrieval, with variants including ColQwen2 and ColSmol. It is associated with the ViDoRe benchmark for evaluating retrieval systems.
Frequently asked
- What is illuin-tech/colpali?
- A library for training and running visual document retrievers using Vision Language Models based on ColBERT-style multi-vector embeddings.
- Is colpali open source?
- Yes — illuin-tech/colpali is open source, released under the MIT license.
- What language is colpali written in?
- illuin-tech/colpali is primarily written in Python.
- How popular is colpali?
- illuin-tech/colpali has 2.7k stars on GitHub.
- Where can I find colpali?
- illuin-tech/colpali is on GitHub at https://github.com/illuin-tech/colpali.