Autoregressive models decode one token at a time. Diffusion LLMs generate tokens in parallel at 1,000+ per second — but break KV-cache, streaming, and length handling.