facebookresearch/multimodal
A PyTorch library for training multimodal and vision-language models at scale.

Not currently ranked — collecting fresh signals.
star history
TorchMultimodal provides modular and composable building blocks including fusion layers, loss functions, and datasets for building multimodal models. It includes implementations of canonical state-of-the-art models like ALBEF and BLIP-2 with pretrained weights. The library enables researchers to replicate published models and serves as a foundation for future multimodal research combining content understanding and generative capabilities.
Frequently asked
- What is facebookresearch/multimodal?
- A PyTorch library for training multimodal and vision-language models at scale.
- Is multimodal open source?
- Yes — facebookresearch/multimodal is open source, released under the BSD-3-Clause license.
- What language is multimodal written in?
- facebookresearch/multimodal is primarily written in Python.
- How popular is multimodal?
- facebookresearch/multimodal has 1.7k stars on GitHub.
- Where can I find multimodal?
- facebookresearch/multimodal is on GitHub at https://github.com/facebookresearch/multimodal.