inclusionAI/Ming-UniAudio
Ming-UniAudio is a speech language model that unifies speech understanding, generation, and editing within a single end-to-end framework using a continuous speech tokenizer.

Ming-UniAudio is a speech language model that unifies speech understanding, generation, and editing tasks using a unified continuous speech tokenizer that bridges semantic and acoustic features in an end-to-end model. It provides a foundation model capable of both generation and understanding in the speech domain, and includes a dedicated speech editing model for natural language-guided free-form speech editing without requiring manual region specification.
Frequently asked
- What is inclusionAI/Ming-UniAudio?
- Ming-UniAudio is a speech language model that unifies speech understanding, generation, and editing within a single end-to-end framework using a continuous speech tokenizer.
- Is Ming-UniAudio open source?
- Yes — inclusionAI/Ming-UniAudio is open source, released under the MIT license.
- What language is Ming-UniAudio written in?
- inclusionAI/Ming-UniAudio is primarily written in Python.
- How popular is Ming-UniAudio?
- inclusionAI/Ming-UniAudio has 450 stars on GitHub.
- Where can I find Ming-UniAudio?
- inclusionAI/Ming-UniAudio is on GitHub at https://github.com/inclusionAI/Ming-UniAudio.