Token Embedding & Positional Encoding
When text enters a Transformer, each token string is mapped to an integer token ID from a vocabulary matrix V of size |V| (e.g., 50,257 for GPT-2 or 100,277 for GPT-4o). An embedding lookup matrix WE ∈ ℝ|V| × dmodel translates each discrete token ID into a continuous dense embedding vector E ∈ ℝn × dmodel.
Because self-attention operations are inherently permutation-invariant (order-agnostic), Transformers inject sequential position information via a positional encoding tensor P ∈ ℝn × dmodel. In traditional architectures, this is computed via sinusoidal harmonic frequencies or learned absolute tables:
- Sinusoidal Evens: PE(pos, 2i) = sin(pos / 100002i / dmodel)
- Sinusoidal Odds: PE(pos, 2i+1) = cos(pos / 100002i / dmodel)
- Modern LLMs: RoPE (Rotary Position Embeddings) apply a 2D rotation matrix directly to Q and K vectors.