Living systematic review

LLM reasoning / chain-of-thought

Eliciting multi-step reasoning from LLMs — chain/tree-of-thought, self-consistency, process reward models, self-refinement, and test-time compute scaling.

391 papers892 critique receipts2,230 benchmark resultsupdated Jun 18, 2026

Most-superseded baselines

Ranked by how many distinct papers critique or beat each method — the standard baselines newer work routinely measures against.

  1. 1
    Chain-of-Thought

    Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

    25 critique · 13 beaten on benchmarks

  2. 2
    Self-Consistencyin Chain-of-Thought

    Self-Consistency Improves Chain of Thought Reasoning in Language Models

    24 critique · 9 beaten on benchmarks

  3. 3
    ToTin Chain-of-Thought

    Tree of Thoughts: Deliberate Problem Solving with Large Language Models

    9 critique · 5 beaten on benchmarks

  4. 4
    ORM

    10 critique · 4 beaten on benchmarks

  5. 5
    Math-Shepherdin ORM

    Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations

    5 critique · 8 beaten on benchmarks

  6. 6
    PRMin Chain-of-Thought

    Let's Verify Step by Step

    7 critique · 3 beaten on benchmarks

  7. 7
    ReAct

    ReAct: Synergizing Reasoning and Acting in Language Models

    5 critique · 3 beaten on benchmarks

  8. 8
    Best-of-Nin Chain-of-Thought

    3 critique · 4 beaten on benchmarks

  9. 9
    Self-Refinein Chain-of-Thought

    Self-Refine: Iterative Refinement with Self-Feedback

    4 critique · 3 beaten on benchmarks

  10. 10
    GRPO

    DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

    5 critique · 0 beaten on benchmarks

  11. 11
    H-CoT

    H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking

    2 critique · 2 beaten on benchmarks

  12. 12
    MCTS

    2 critique · 2 beaten on benchmarks

The competition

Methods that fight on the same benchmarks cluster into distinct sub-problems.

The frontier

Recent methods not yet superseded in the knowledge base.