We introduce SEA-Vision, a benchmark that jointly evaluates Document Parsing and Text-Centric VQA across 11 Southeast Asian languages. Models that perform well on English and Chinese degrade substantially on low-resource SEA scripts — SEA-Vision quantifies this gap.
Two sub-benchmarks, one unified evaluation framework
Normalized Edit Distance (NED↓) — lower is better. Color: green = good, red = poor.
Accuracy (%) — higher is better. Closed-source in purple, open-source in blue.
What the benchmark reveals about current MLLMs
GT-annotated document parsing examples — 11 languages × 9 page types.
🇬🇧 EN
Book
🇬🇧 EN
Note
🇬🇧 EN
Textbook
🇬🇧 EN
Academic
🇬🇧 EN
Report
🇬🇧 EN
Slide
🇬🇧 EN
Exam
🇬🇧 EN
Magazine
🇬🇧 EN
Newspaper
🇨🇳 ZH
Book
🇨🇳 ZH
Note
🇨🇳 ZH
Textbook
🇨🇳 ZH
Academic
🇨🇳 ZH
Report
🇨🇳 ZH
Slide
🇨🇳 ZH
Exam
🇨🇳 ZH
Magazine
🇨🇳 ZH
Newspaper
🇮🇩 ID
Book
🇮🇩 ID
Note
🇮🇩 ID
Textbook
🇮🇩 ID
Academic
🇮🇩 ID
Report
🇮🇩 ID
Slide
🇮🇩 ID
Exam
🇮🇩 ID
Magazine
🇮🇩 ID
Newspaper
🇧🇷 PT
Book
🇧🇷 PT
Note
🇧🇷 PT
Textbook
🇧🇷 PT
Academic
🇧🇷 PT
Report
🇧🇷 PT
Slide
🇧🇷 PT
Exam
🇧🇷 PT
Magazine
🇧🇷 PT
Newspaper
🇲🇾 MS
Book
🇲🇾 MS
Note
🇲🇾 MS
Textbook
🇲🇾 MS
Academic
🇲🇾 MS
Report
🇲🇾 MS
Slide
🇲🇾 MS
Exam
🇲🇾 MS
Magazine
🇲🇾 MS
Newspaper
🇻🇳 VI
Book
🇻🇳 VI
Note
🇻🇳 VI
Textbook
🇻🇳 VI
Academic
🇻🇳 VI
Report
🇻🇳 VI
Slide
🇻🇳 VI
Exam
🇻🇳 VI
Magazine
🇻🇳 VI
Newspaper
🇹🇭 TH
Book
🇹🇭 TH
Note
🇹🇭 TH
Textbook
🇹🇭 TH
Academic
🇹🇭 TH
Report
🇹🇭 TH
Slide
🇹🇭 TH
Exam
🇹🇭 TH
Magazine
🇹🇭 TH
Newspaper
🇵🇭 FIL
Book
🇵🇭 FIL
Note
🇵🇭 FIL
Textbook
🇵🇭 FIL
Academic
🇵🇭 FIL
Report
🇵🇭 FIL
Slide
🇵🇭 FIL
Exam
🇵🇭 FIL
Magazine
🇵🇭 FIL
Newspaper
🇱🇦 LO
Book
🇱🇦 LO
Note
🇱🇦 LO
Textbook
🇱🇦 LO
Academic
🇱🇦 LO
Report
🇱🇦 LO
Slide
🇱🇦 LO
Exam
🇱🇦 LO
Magazine
🇱🇦 LO
Newspaper
🇰🇭 KM
Book
🇰🇭 KM
Note
🇰🇭 KM
Textbook
🇰🇭 KM
Academic
🇰🇭 KM
Report
🇰🇭 KM
Slide
🇰🇭 KM
Exam
🇰🇭 KM
Magazine
🇰🇭 KM
Newspaper
🇲🇲 MY
Book
🇲🇲 MY
Note
🇲🇲 MY
Textbook
🇲🇲 MY
Academic
🇲🇲 MY
Report
🇲🇲 MY
Slide
🇲🇲 MY
Exam
🇲🇲 MY
Magazine
🇲🇲 MY
Newspaper
Real QA examples from TEC-VQA across all 11 languages and 5 reasoning types. Questions and answers are in the target language, drawn from real-world text-rich images.
🇬🇧 EN
Recognize
🇬🇧 EN
Compute
🇬🇧 EN
Compare
🇬🇧 EN
Logic
🇬🇧 EN
Spatial
🇬🇧 EN
Recognize
🇬🇧 EN
Compute
🇬🇧 EN
Compare
🇬🇧 EN
Logic
🇬🇧 EN
Spatial
🇨🇳 ZH
Recognize
🇨🇳 ZH
Compute
🇨🇳 ZH
Compare
🇨🇳 ZH
Logic
🇨🇳 ZH
Spatial
🇨🇳 ZH
Recognize
🇨🇳 ZH
Compute
🇨🇳 ZH
Compare
🇨🇳 ZH
Logic
🇨🇳 ZH
Spatial
🇮🇩 ID
Recognize
🇮🇩 ID
Compute
🇮🇩 ID
Compare
🇮🇩 ID
Logic
🇮🇩 ID
Spatial
🇮🇩 ID
Recognize
🇮🇩 ID
Compute
🇮🇩 ID
Compare
🇮🇩 ID
Logic
🇮🇩 ID
Spatial
🇵🇹 PT
Recognize
🇵🇹 PT
Compute
🇵🇹 PT
Compare
🇵🇹 PT
Logic
🇵🇹 PT
Spatial
🇵🇹 PT
Recognize
🇵🇹 PT
Compute
🇵🇹 PT
Compare
🇵🇹 PT
Logic
🇵🇹 PT
Spatial
🇲🇾 MS
Recognize
🇲🇾 MS
Compute
🇲🇾 MS
Compare
🇲🇾 MS
Logic
🇲🇾 MS
Spatial
🇲🇾 MS
Recognize
🇲🇾 MS
Compute
🇲🇾 MS
Compare
🇲🇾 MS
Logic
🇲🇾 MS
Spatial
🇻🇳 VI
Recognize
🇻🇳 VI
Compute
🇻🇳 VI
Compare
🇻🇳 VI
Logic
🇻🇳 VI
Spatial
🇻🇳 VI
Recognize
🇻🇳 VI
Compute
🇻🇳 VI
Compare
🇻🇳 VI
Logic
🇻🇳 VI
Spatial
🇹🇭 TH
Recognize
🇹🇭 TH
Compute
🇹🇭 TH
Compare
🇹🇭 TH
Logic
🇹🇭 TH
Spatial
🇹🇭 TH
Recognize
🇹🇭 TH
Compute
🇹🇭 TH
Compare
🇹🇭 TH
Logic
🇹🇭 TH
Spatial
🇵🇭 FIL
Recognize
🇵🇭 FIL
Compute
🇵🇭 FIL
Compare
🇵🇭 FIL
Logic
🇵🇭 FIL
Spatial
🇵🇭 FIL
Recognize
🇵🇭 FIL
Compute
🇵🇭 FIL
Compare
🇵🇭 FIL
Logic
🇵🇭 FIL
Spatial
🇱🇦 LO
Recognize
🇱🇦 LO
Compute
🇱🇦 LO
Compare
🇱🇦 LO
Logic
🇱🇦 LO
Spatial
🇱🇦 LO
Recognize
🇱🇦 LO
Compute
🇱🇦 LO
Compare
🇱🇦 LO
Logic
🇱🇦 LO
Spatial
🇰🇭 KM
Recognize
🇰🇭 KM
Compute
🇰🇭 KM
Compare
🇰🇭 KM
Logic
🇰🇭 KM
Spatial
🇰🇭 KM
Recognize
🇰🇭 KM
Compute
🇰🇭 KM
Compare
🇰🇭 KM
Logic
🇰🇭 KM
Spatial
🇲🇲 MY
Recognize
🇲🇲 MY
Compute
🇲🇲 MY
Compare
🇲🇲 MY
Logic
🇲🇲 MY
Spatial
🇲🇲 MY
Recognize
🇲🇲 MY
Compute
🇲🇲 MY
Compare
🇲🇲 MY
Logic
🇲🇲 MY
Spatial
Hybrid automated + native-speaker verification pipeline for both tasks
(a) Document Parsing: web scraping → layout detection → rule-based scoring → MLLM region correction → human verification. (b) TEC-VQA: scene collection → re-rendering into target languages → MLLM QA generation → cross-lingual consistency check → native-speaker review.
If you use SEA-Vision in your research, please cite:
@inproceedings{yue2026seavision,
title = {SEA-Vision: A Multilingual Benchmark for Comprehensive
Document and Scene Text Understanding in Southeast Asia},
author = {Yue, Pengfei and Zhao, Xingran and Chen, Juntao and
Hou, Peng and Longchao, Wang and Lin, Jianghang and
Zhang, Shengchuan and Zeng, Anxiang and Cao, Liujuan},
booktitle = {Proceedings of the IEEE/CVF Conference on
Computer Vision and Pattern Recognition (CVPR)},
year = {2026}
}