PKU-YuanGroup/LLaVA-CoT
LLaVA-CoT is an open-source visual language model designed for systematic chain-of-thought reasoning across multimodal inputs.

Not currently ranked — collecting fresh signals.
star history
This project develops a multimodal large language model that performs step-by-step reasoning on visual inputs. It combines vision encoding with language model reasoning to enable structured, interpretable answers on visual understanding tasks. The repository includes both training code and inference scripts, and the model was trained on a dataset of 100k reasoning examples.
Frequently asked
- What is PKU-YuanGroup/LLaVA-CoT?
- LLaVA-CoT is an open-source visual language model designed for systematic chain-of-thought reasoning across multimodal inputs.
- Is LLaVA-CoT open source?
- Yes — PKU-YuanGroup/LLaVA-CoT is open source, released under the Apache-2.0 license.
- What language is LLaVA-CoT written in?
- PKU-YuanGroup/LLaVA-CoT is primarily written in Python.
- How popular is LLaVA-CoT?
- PKU-YuanGroup/LLaVA-CoT has 2.1k stars on GitHub.
- Where can I find LLaVA-CoT?
- PKU-YuanGroup/LLaVA-CoT is on GitHub at https://github.com/PKU-YuanGroup/LLaVA-CoT.