jishengpeng/WavTokenizer
A discrete audio codec that compresses speech, music, and audio into 40-75 tokens per second for use in language model pipelines.

Not currently ranked — collecting fresh signals.
star history
WavTokenizer is a state-of-the-art discrete acoustic codec model that tokenizes audio into 40 or 75 tokens per second. It encodes speech, music, and general audio into discrete semantic tokens suitable for audio language modeling tasks similar to GPT-4o. The model supports reconstruction of audio from discrete tokens and is intended as a front-end component for generative audio models and multimodal LLM systems.
Frequently asked
- What is jishengpeng/WavTokenizer?
- A discrete audio codec that compresses speech, music, and audio into 40-75 tokens per second for use in language model pipelines.
- Is WavTokenizer open source?
- Yes — jishengpeng/WavTokenizer is open source, released under the MIT license.
- What language is WavTokenizer written in?
- jishengpeng/WavTokenizer is primarily written in Python.
- How popular is WavTokenizer?
- jishengpeng/WavTokenizer has 1.3k stars on GitHub.
- Where can I find WavTokenizer?
- jishengpeng/WavTokenizer is on GitHub at https://github.com/jishengpeng/WavTokenizer.