Living systematic review

Speculative decoding

Speeding up autoregressive LLM generation by drafting tokens cheaply and verifying them in parallel.

182 papers333 critique receipts1,849 benchmark resultsupdated Jun 18, 2026

Most-superseded baselines

Ranked by how many distinct papers critique or beat each method — the standard baselines newer work routinely measures against.

  1. 1
    EAGLE-3

    EAGLE-3: Scaling up Inference Acceleration of Large Language Models via Training-Time Test

    13 critique · 28 beaten on benchmarks

  2. 2
    EAGLE-2

    EAGLE-2: Faster Inference of Language Models with Dynamic Draft Trees

    10 critique · 21 beaten on benchmarks

  3. 3
    EAGLEin EAGLE-2

    EAGLE: Speculative Sampling Requires Rethinking Feature Uncertainty

    19 critique · 12 beaten on benchmarks

  4. 4
    Medusain EAGLE-2

    Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads

    19 critique · 9 beaten on benchmarks

  5. 5
    Lookahead

    Lookahead: An Inference Acceleration Framework for Large Language Model with Lossless Generation Accuracy

    8 critique · 13 beaten on benchmarks

  6. 6
    PLDin Lookahead

    PLD+: Accelerating LLM inference by leveraging Language Model Artifacts

    7 critique · 13 beaten on benchmarks

  7. 7
    RESTin Lookahead

    REST: Retrieval-Based Speculative Decoding

    6 critique · 9 beaten on benchmarks

  8. 8
    SpecInfer

    SpecInfer: Accelerating Generative Large Language Model Serving with Tree-based Speculative Inference and Verification

    10 critique · 4 beaten on benchmarks

  9. 9
    Speculative Samplingin Lookahead

    Speculative Sampling for Parametric Temporal Point Processes

    2 critique · 10 beaten on benchmarks

  10. 10
    DFlashin EAGLE-3

    DFlash: Block Diffusion for Flash Speculative Decoding

    4 critique · 6 beaten on benchmarks

  11. 11
    LayerSkipin SpecInfer

    LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding

    7 critique · 3 beaten on benchmarks

  12. 12
    FR-Spec

    FR-Spec: Accelerating Large-Vocabulary Language Models via Frequency-Ranked Speculative Sampling

    4 critique · 5 beaten on benchmarks

The competition

Methods that fight on the same benchmarks cluster into distinct sub-problems.

The frontier

Recent methods not yet superseded in the knowledge base.