FP6 quantization outperforms INT4 in diverse generative tasks for LLMs.
problem Limited performance of 4-bit quantization methods in diverse generative tasks.
method Proposes a 4+2 design for FP6 quantization to achieve similar latency to INT4.
result FP6 quantization outperforms INT4 in various generative tasks, including code generation and summarization.