IBM/CrossViT
CrossViT is a vision transformer model that uses cross-attention across multiple scales for image classification.

Not currently ranked — collecting fresh signals.
star history
This repository provides the official PyTorch implementation of CrossViT, a vision transformer architecture that combines multi-scale features through cross-attention mechanisms for improved image classification on ImageNet. The implementation includes training scripts, pretrained model weights, and supports distributed multi-GPU training.
Frequently asked
- What is IBM/CrossViT?
- CrossViT is a vision transformer model that uses cross-attention across multiple scales for image classification.
- Is CrossViT open source?
- Yes — IBM/CrossViT is open source, released under the Apache-2.0 license.
- What language is CrossViT written in?
- IBM/CrossViT is primarily written in Python.
- How popular is CrossViT?
- IBM/CrossViT has 418 stars on GitHub.
- Where can I find CrossViT?
- IBM/CrossViT is on GitHub at https://github.com/IBM/CrossViT.