Skip to content

benchmark

SWE-Serve

Benchmark that scores coding agents on repository-scale changes to LLM inference-serving code, built from merged SGLang pull requests and verified with hidden test suites, some of which start a real server and load a model.

Known aliases

  • SWE-Serve benchmark

Relationships

No evidence-backed relationships are recorded.

Current clusters