official jaywalnut310/vits repository, paper and LJSpeech config
VITS / END-TO-END TTS / 2021
VITS · LJSpeech
TOTAL≈36Mparameters
ACTIVE≈36Mruntime path
DEPTH6 + flowrepeated blocks
HIDDEN192main trunk
CONTEXTutterancestream / sequence
CHECKPOINT≈145MB1 shards · MIT
INPUT128TOKENS
TRANSFORMER STACKVAE + FLOW + GANtext prior ↔ posterior latent → parallel waveform decoder
Multi-Module Residual
++
OUTPUT10SECONDS
wraps every repeated block
TEXT SELF-ATTENTION · STOCHASTIC DURATION PREDICTOR时长不是确定回归,而是从条件分布采样,保留韵律多样性。
Normalizing Flow VAE训练用 posterior 声学信息,推理把文本 prior 通过逆 flow 映射到 decoder latent。
TEXT6LTransformer
HIDDEN192encoder
FLOW4coupling blocks
VOCODERGANdecoder
SAMPLE22.05kHz
PARAMS≈36MLJS