Skip to content

Topic

Model quantisation

Compressing model weights from higher-precision floats to lower-precision integers to cut memory use, trading some output quality for a smaller file.

Current clusters