Cascading Failure Amplification in Multi-Step LLM Reasoning: Operational Definitions, Trace-Level Diagnostics, and Intervention Analysis
Abstract
Chain-of-thought prompting enables multi-step reasoning in large language models, yet intermediate errors can propagate and amplify into downstream failures. We introduce the Amplification Factor (AF), a risk-ratio metric that quantifies cascading failure by measuring how much more likely an error becomes after a prior error has occurred. Across three model families on GSM8K (14,558 step-level records, 2,119 traces), we find AF = 7.79 for GPT-4o-mini, AF = 3.29 for Llama-3.1-8B, and AF = 7.01 for Qwen-2.5-72B, establishing cascading amplification as a general phenomenon: roughly half of all post-error steps contain new errors regardless of model. Controlled error-injection experiments show that positional vulnerability increases with step index, with late-step errors causing substantially greater downstream damage. Evaluating inference-time interventions, we find that cross-verification reduces cascade rates from 24% to 9%, while step-level self-checking is harmful, reducing accuracy from 52% to 36%. These results provide operational definitions, trace-level diagnostics, and actionable guidance for allocating verification compute in multi-step reasoning systems.