Skip to content

benchmark

Terminal Bench 2.1

Agentic terminal benchmark reported by Qwen at 73.0 for the 27B model.

Known aliases

  • harborframework/terminal-bench-2.1
  • TerminalBench 2.1

Relationships

No evidence-backed relationships are recorded.

Current stories

build2 publishers

GitHub bills HydraFusion by every model leg its router decides to call

The Copilot research preview picks a single, cascade, or critique workflow per request, and you pay standard Copilot rates for every token in every leg. So the router has to save more expensive inference than the extra calls cost.

Perspective Coverage

3 publishers
Builder
Builder 58%
Operator
Operator 28%
Investor
Investor 14%

Reality

Evidence55
Adoption
Insufficient
Hype gap+30
Incentives70
Confidence60