NanoQuant: Efficient Sub-1-Bit Quantization of Large Language Models
International Conference on Machine Learning (ICML),
NanoQuant enables sub-1-bit large language models through post-training quantization (PTQ), using robust initialization and efficient reconstruction to outperform existing binary PTQ methods.