← バックナンバーINFERENCEHugging Face
Hugging Face、4-bit圧縮LLMのQuantization-Aware Healingを紹介
Multiverse Computing CAIはHugging FaceでQuantization-Aware Healingを紹介しました。GPT-OSS 120Bを60B parametersへ圧縮しMXFP4へquantizeしたmodelで、full-precision bfloat16版を9 benchmarks中7件で上回ったと説明しています。
公式発表を読む