Skip to yearly menu bar Skip to main content


Self-Distillation for Data-Scarce Language Model Pretraining

Javid Lakha ⋅ Nihal Nayak ⋅ Bingbin Liu ⋅ Sham Kakade ⋅ David Alvarez-Melis

Abstract

Chat is not available.