Skip to yearly menu bar Skip to main content


Poster
in
Workshop: SCALE: SCALABLE LEARNING AND OPTIMIZATION FOR EFFICIENT MULTIMODAL AI AGENTS
Fri, Jul 10, 2026 • 4:20 PM – 5:00 PM KST

ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

Amir Ziashahabi ⋅ Hossein Entezari Zarch ⋅ Lei Gao ⋅ Murali Annavaram ⋅ Salman Avestimehr

Abstract

Chat is not available.