Tool use / function calling

Reflexion

Reflexion: Language Agents with Verbal Reinforcement Learning

Superseded baseline#45 of 55 most-superseded · first seen Mar 20, 2023

Cited as a baseline — critiqued by newer work, not yet beaten on a benchmark here

1 papers critique it · 0 beat it on benchmarks

What papers say

Verbatim critique sentences, each from a paper that cites Reflexion as a baseline.

Our work differs by using a specialized reviewer agent instead of self-feedback, demonstrating that external feedback from reasoning models outperforms self-correction.
Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

What to use instead

Recent methods in the same sub-problem, not yet superseded in the knowledge base — arXiv benchmark leaders, not vetted production recommendations.