Motor de Códec Neuronal Acústico
Tokenizador de Audio
Explora la tokenización de audio, frecuencias de tramas acústicas y cuantización vectorial residual (RVQ) multi-código en OpenAI Whisper, EnCodec y Gemini.
Respuesta directa: ¿Qué es el Visualizador de Tokenizador de Audio?
El Visualizador de Tokenizador de Audio es un entorno interactivo para comprender cómo el habla y los sonidos se discretizan en tokens. Inspecciona espectrogramas Mel, frecuencias de tramas, cuantización de libros de códigos y tasas de bits de tokens.
Audio Tokens 0
Duration 0:00.0
Sample Rate 24.0 kHz
Estimated Cost ~$0.0004
Upload or drag & drop an audio file
MP3, WAV, OGG, FLAC, AAC, or WebM. 100% processed locally in your browser.
speech-sample.wav 24kHz Mono
0:00.0 / 0:04.2
Rate: 50 tokens/s
Model Tokenization Specifications
Architecture: Encoder-Decoder Transformer (128-Mel Bins, 50Hz)
Frame Stride / Hop: 20ms (50 acoustic frames/sec)
Target Sample Rate: 16,000 Hz
Chunking Strategy: 30-second fixed context windows
Acoustic Token Segments
Loading audio tokens…
Numeric Token ID Sequence
Numeric token IDs…