Skip to yearly menu bar Skip to main content


Poster
in
Workshop: SCALE: SCALABLE LEARNING AND OPTIMIZATION FOR EFFICIENT MULTIMODAL AI AGENTS
Fri, Jul 10, 2026 • 12:20 AM – 1:00 AM PDT

ASPIRE: Asynchronous Batched Self-Speculative Decoding for Long-Context LLM Inference

Amir Ziashahabi ⋅ Hossein Entezari Zarch ⋅ Lei Gao ⋅ Murali Annavaram ⋅ Salman Avestimehr

Abstract

Chat is not available.