microsoft/SimMIM
Microsoft's official implementation of SimMIM, a self-supervised framework for pre-training vision transformers via masked image modeling.

SimMIM provides a simple framework for masked image modeling to pre-train vision transformers. The approach uses random masking with a moderately large patch size (e.g., 32) and predicts raw pixel RGB values through direct regression. The framework supports pre-training and fine-tuning on ImageNet-1K with Swin Transformer and ViT models, achieving strong representation learning performance without complex prediction head designs.
Frequently asked
- What is microsoft/SimMIM?
- Microsoft's official implementation of SimMIM, a self-supervised framework for pre-training vision transformers via masked image modeling.
- Is SimMIM open source?
- Yes — microsoft/SimMIM is open source, released under the MIT license.
- What language is SimMIM written in?
- microsoft/SimMIM is primarily written in Python.
- How popular is SimMIM?
- microsoft/SimMIM has 1k stars on GitHub.
- Where can I find SimMIM?
- microsoft/SimMIM is on GitHub at https://github.com/microsoft/SimMIM.