Skip to main content
音響ニューラル コーデック エンジン

音声トークナイザー

OpenAI Whisper、EnCodec、Gemini における音声トークン化、音響フレーム周波数、マルチコード残差ベクトル量子化(RVQ)を探索。

ダイレクト回答: 音声トークナイザー可視化ツールとは何ですか?

音声トークナイザー可視化ツール は、音声やサウンドがどのように離散的なトークンに変換されるかを理解するためのインタラクティブな環境です。メルスペクトログラム、フレームレート、コードブック量子化、トークンビットレートを検査します。

Audio Tokens 0
Duration 0:00.0
Sample Rate 24.0 kHz
Estimated Cost ~$0.0004

Upload or drag & drop an audio file

MP3, WAV, OGG, FLAC, AAC, or WebM. 100% processed locally in your browser.

speech-sample.wav 24kHz Mono
0:00.0 / 0:04.2
Rate: 50 tokens/s

Model Tokenization Specifications

Architecture: Encoder-Decoder Transformer (128-Mel Bins, 50Hz)
Frame Stride / Hop: 20ms (50 acoustic frames/sec)
Target Sample Rate: 16,000 Hz
Chunking Strategy: 30-second fixed context windows

Acoustic Token Segments

Loading audio tokens…
Numeric Token ID Sequence
Numeric token IDs…