Audio8 TTS Preview 0.6B: multilingual TTS model with zero-shot voice cloning

nateb20221 pts0 comments

Audio8/Audio8-TTS-Preview-0.6b 路 Hugging Face

Log In<br>Sign Up

","pad_token":"","unk_token":null}},"createdAt":"2026-07-28T07:53:00.000Z","discussionsDisabled":false,"discussionsSorting":"recently-created","downloads":225,"downloadsAllTime":225,"id":"Audio8/Audio8-TTS-Preview-0.6b","isLikedByUser":false,"availableInferenceProviders":[],"showHuggingChatEntry":false,"inference":"","lastModified":"2026-07-29T07:52:16.000Z","likes":83,"pipeline_tag":"text-to-speech","library_name":"transformers","librariesOther":[],"trackDownloads":true,"model-index":null,"private":false,"repoType":"model","gated":false,"tags":["transformers","safetensors","arktts","feature-extraction","audio","text-to-speech","tts","voice-cloning","zero-shot","multilingual","custom_code","yue","zh","nl","en","fr","de","it","ja","ko","pl","es","license:apache-2.0","region:us"],"tag_objs":[{"id":"text-to-speech","label":"Text-to-Speech","type":"pipeline_tag","subType":"audio"},{"id":"transformers","label":"Transformers","type":"library"},{"id":"safetensors","label":"Safetensors","type":"library"},{"id":"yue","label":"Yue Chinese","type":"language"},{"id":"zh","label":"Chinese","type":"language"},{"id":"nl","label":"Dutch","type":"language"},{"id":"en","label":"English","type":"language"},{"id":"fr","label":"French","type":"language"},{"id":"de","label":"German","type":"language"},{"id":"it","label":"Italian","type":"language"},{"id":"ja","label":"Japanese","type":"language"},{"id":"ko","label":"Korean","type":"language"},{"id":"pl","label":"Polish","type":"language"},{"id":"es","label":"Spanish","type":"language"},{"id":"arktts","label":"arktts","type":"other","clickable":true},{"id":"feature-extraction","label":"feature-extraction","type":"other","clickable":true},{"id":"audio","label":"audio","type":"other","clickable":true},{"id":"tts","label":"tts","type":"other","clickable":true},{"id":"voice-cloning","label":"voice-cloning","type":"other","clickable":true},{"id":"zero-shot","label":"zero-shot","type":"other","clickable":true},{"id":"multilingual","label":"multilingual","type":"other","clickable":true},{"id":"custom_code","label":"custom_code","type":"other","clickable":true},{"id":"license:apache-2.0","label":"apache-2.0","type":"license"},{"type":"region","label":"馃嚭馃嚫 Region: US","id":"region:us"}],"transformersInfo":{"auto_model":"AutoModel","custom_class":"modeling_arktts.ArkttsModel","pipeline_tag":"feature-extraction"},"safetensors":{"parameters":{"BF16":601159424},"total":601159424,"sharded":false,"totalFileSize":1202342528},"hasBlockedOids":false,"region":"us","isQuantized":false},"discussionsStats":{"closed":0,"open":1,"total":1},"query":{},"inferenceContextData":{"billableEntities":[],"entityName2Providers":{}},"hasQuantizations":false,"copyToBucketNamespaces":[]}">

Audio8 TTS Preview 0.6B: SOTA-Class TTS at Compact Scale

A 0.6B-parameter multilingual text-to-speech model with zero-shot voice cloning.

Audio8 TTS Preview supports multilingual speech generation and zero-shot voice<br>cloning. This repository contains the complete checkpoint, its 44.1 kHz neural<br>audio codec, tokenizer, processor, and Hugging Face remote code.

Preview status: Language coverage is intentionally limited in this<br>release. For the best results, use one of the 11 recommended languages below.<br>Broader multilingual coverage and Chinese dialect support are planned for<br>future releases.

Supported Languages

Cantonese 路<br>Chinese 路<br>Dutch 路<br>English

French 路<br>German 路<br>Italian 路<br>Japanese

Korean 路<br>Polish 路<br>Spanish

Model Details

Audio8 TTS uses a DualAR architecture inspired by<br>Fish Audio S2 Pro. The slow AR<br>transformer predicts one semantic token for each audio frame. The fast AR<br>transformer predicts the frame's codec codebooks, conditioned on the slow hidden<br>state and preceding codebooks.

Component<br>Configuration

Main model<br>601,159,424 parameters, excluding the codec

Slow AR<br>24 layers, width 896, 14 attention heads, 2 KV heads

Fast AR<br>4 layers, width 896, 14 attention heads, 2 KV heads

Acoustic tokens<br>10 codebooks, 4,096 entries per codebook

Codec<br>44.1 kHz, 2,048 samples per model frame (~21.5 frames/s)

Context<br>Up to 2,048 packed text/audio positions

The bundled codec handles both reference-audio encoding and waveform decoding,<br>so no additional codec checkpoint is required.

Installation

Python 3.10 or newer and a CUDA-capable GPU are recommended.

pip install "torch>=2.5.0" "torchaudio>=2.5.0" \<br>"transformers>=4.57.0, "soundfile>=0.12" "safetensors>=0.4"

Usage

The model uses custom Transformers code. Review the files in this repository,<br>then load it with trust_remote_code=True.

Zero-shot voice cloning

The reference transcript must match the spoken content in the reference audio.

import soundfile as sf<br>import torch<br>from transformers import AutoModel, AutoProcessor

model_id = "AutoArk-AI/Audio8-TTS-Preview-0.6b"<br>device = "cuda" if torch.cuda.is_available() else "cpu"<br>dtype = torch.bfloat16 if device == "cuda" else torch.float32

processor =...

label type language true audio audio8

Related Articles