Skip to content

benchmark

Terminal-Bench 3.0

Agentic terminal-task benchmark where GLM-5.3 scored 28.3 versus GLM-5.2's 4.6.

Known aliases

  • Terminal Bench 3.0

Relationships

No evidence-backed relationships are recorded.

Current stories