Skip to content

Topic

Blended inference

Serving a single request by calling several models in parallel and synthesizing their outputs into one answer, instead of selecting one model per request.

Current clusters