Background소속: Microsoft Research, University of Chinese Academy of Sciences게재:Abstract & 1 Introduction✔️ 기존 양자화 방법들 학습 후 양자화 적용- 훈련 파이프라인 수정과 모델 재훈련 불필요 => 간단하고 적용이 쉬움- 학습 모델이 양자화가 적용된 표현에 최적화되지 않아 성능이 저하됨 양자화 인식 훈련(quantization-aware training)- 학습 후 양자화 적용보다는 높은 정확도, 지속적인 학습이나 fine-tuning 가능- 모델의 최적화가 어렵고 scaling law of neural language models를 따르는지 알 수 없음 📌 BitNetLLM을 위한 1-bit Transformer arc..