Skip to content

Topic

Low-bit quantization

Running neural network arithmetic in eight-bit, four-bit or similar reduced formats to cut memory movement and speed up matrix multiplication.

Current clusters