Multilingual Synthetic Scanpaths: Cross-Language Generalization for Gaze Generation
Abstract
Eye movements during reading provide rich signals of attention and comprehension, enabling applications from readability assessment and adaptive educational technology to accessibility tools such as gaze-controlled communication. However, eye-tracking data is costly and scarce, especially for low-resource languages. To address this, we introduce a multilingual sequential generative model for scanpath generation. Multilingual training enables the model to capture shared gaze patterns, outperform monolingual baselines, and generalize across languages, particularly when typological similarities are present. Beyond gaze prediction evaluation, we show that synthetic gaze signals from our generative model may improve downstream tasks. In a multilingual question answering benchmark, adding gaze signals improves performance even in languages with no eye-tracking data during training.