2026-08-12 ジョージア工科大学
<関連情報>
- https://news.research.gatech.edu/2026/08/12/new-model-teaches-workplace-ai-read-more-humans
- https://arxiv.org/abs/2510.26615
- https://arxiv.org/pdf/2510.26615
SlideAgent:複数ページにわたる視覚的文書の理解のための階層型エージェントフレームワーク SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding
Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar
arXiv last revised 5 Jun 2026 (this version, v4)
DOI:https://doi.org/10.48550/arXiv.2510.26615

Abstract
Multi-page visual documents such as manuals, brochures, presentations, and posters convey key information through layout, colors, icons, and cross-slide references. While multimodal large language models (MLLMs) offer opportunities in document understanding, current systems struggle with complex, multi-page visual documents, particularly in fine-grained reasoning over elements and pages. We introduce SlideAgent, a versatile agentic framework for understanding multi-modal, multi-page, and multi-layout documents, especially slide decks. SlideAgent employs specialized agents and decomposes reasoning into three specialized levels–global, page, and element–to construct a structured, query-agnostic representation that captures both overarching themes and detailed visual or textual cues. During inference, SlideAgent selectively activates specialized agents for multi-level reasoning and integrates their outputs into coherent, context-aware answers. Extensive experiments show that SlideAgent significantly improves accuracy over both proprietary (+7.9%) and open-source models (+9.8%).

