microsoft/XPretrain
Multi-modality pre-training research repository from Microsoft Research covering video-language and image-language foundation models.

This repository contains recent research works from Microsoft Research’s Multimedia Search and Mining group focused on multi-modality learning, particularly pre-training methods. It includes models for video-language understanding (HD-VILA, LF-VILA, CLIP-ViP) and image-language understanding (Pixel-BERT, SOHO, VisualParsing), along with the HD-VILA-100M large-scale video-language dataset. The models use Transformer architectures and are trained with self-supervised pre-training objectives on visual and textual data.
Frequently asked
- What is microsoft/XPretrain?
- Multi-modality pre-training research repository from Microsoft Research covering video-language and image-language foundation models.
- Is XPretrain open source?
- Yes — microsoft/XPretrain is an open-source project tracked on heatdrop.
- What language is XPretrain written in?
- microsoft/XPretrain is primarily written in Python.
- How popular is XPretrain?
- microsoft/XPretrain has 511 stars on GitHub.
- Where can I find XPretrain?
- microsoft/XPretrain is on GitHub at https://github.com/microsoft/XPretrain.