Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning
-
Aug. 2026
CURV
William & Mary
CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning
-
Aug. 2026
DocTrace — Casts LongDocVQA as explicit evidence graph reasoning rather than implicit answer prediction, with a hierarchical framework that progressively localizes evidence, parses document structure, and performs graph-based reasoning.
CURV — A curriculum learning framework that develops intrinsic visual reasoning capabilities by reformulating CQA as multi-step visual grounded reasoning, where each step coordinates logical reasoning with dynamic visual grounding through spatial attention concentration.
Visual Text Generation
Venue
Name
Primary affiliation
Title
GitHub
Date
onoff
GIST
Bridging Online and Offline Handwriting via Differentiable Physical Rendering
Aug. 2026
onoff — a unified framework that bridges online and offline handwriting generation, consisting of a differentiable brush renderer, an online stroke generator, a brush parameter observer and a zero-shot offline image enhancer.
Benchmarks & Evaluation
Venue
Name
Primary affiliation
Title
GitHub
Date
ChartAnno
Fudan University
ChartAnno: Evaluating MLLMs for Chart Annotation Generation
-
Aug. 2026
BanglaWild
IUT
BanglaWild: An In-the-Wild Bengali Scene Text Recognition Benchmark for OCR and Vision-Language Models
-
Aug. 2026
ChartAnno — A benchmark for evaluating MLLMs on chart annotation generation. It contains 1,200 real-world charts with paired code and annotation instructions across three levels of instruction specificity.
BanglaWild — The first in-the-wild Bengali scene text recognition benchmark to pair dual verbatim/standard annotation with evaluation of both conventional OCR and generative VLMs on the same data.
A curated, continuously updated reading list of OCR in the era of large language models, covering document parsing and understanding, visual text generation, benchmarks, challenges, and future perspectives, with a focus on research around the past five years (2021–now).
Scope. This list tracks OCR in the LLM era: work that applies large vision-language or multimodal models to text-rich images and documents (parsing, understanding, benchmarks, and specialized text tasks). It is not a general document-AI list, a generic MLLM list, or a classical OCR-1.0 list; such work appears only when it directly bears on text-rich visual understanding.
A note on evaluation. Most recent systems are released as technical reports with self-reported numbers, private test sets, and inconsistent protocols, so cross-paper scores are rarely comparable in a rigorous sense. We list results as reported and, where known, indicate the evaluation basis. The field still lacks a unified, contamination-resistant, reproducible benchmark, and we see building one as a prerequisite for trustworthy leaderboard claims.
🎉 News
[2026-2-11] 🔥 We release an open-source resource to help the community easily track recent OCR research!
Contributing. PRs welcome. One row per model, newest first; please include venue/date, affiliation, and a code or model link.
Reinforcement learning for layout and reading order modeling.
OCR-free document understanding models.
Scaling down: compact document VLMs under 1B parameters.
Long-doc OCR is a scaling problem of tokens and consistency, not just context length.
Structure (layout + logic) is the new accuracy.
Generative OCR shifts the core risk from “misrecognition” to “hallucination”.
Benchmarks are moving toward executable evaluation.
Document agents and autonomous reasoning over PDFs.
Document Agents need recoverability, not one-shot perfection.
📄 Document Parsing
Document parsing focuses on converting visually complex documents into structured, machine-readable representations. In the LLM era, parsing is no longer a pipeline of isolated modules, but increasingly unified within end-to-end VLM architectures.
Venue
Name
Primary affiliation
Title
GitHub
Date
Logographic Pretraining
QMUL
Logographic Character Visual Pretraining via Semantic-based Contrastive Learning
-
Aug. 2026
SPIRAL
SEU
Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression
Aug. 2026
DocPO
Tencent
DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
-
Aug. 2026
DrawAI
BUPT
DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable
Aug. 2026
LayoutLite
Yuanli Technology
LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR
Visual Text Generation focuses on generating or editing legible, visually harmonious, and semantically consistent text within images, serving as the creative inverse of OCR. In the LLM era, it is no longer a task reliant on specialized modules, but is emerging as a foundational skill for general-purpose generative models.
Venue
Name
Primary affiliation
Title
GitHub
Date
PosterMELD
Tsinghua University
PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs
Aug. 2026
InnoText
SYSU
InnoText: A Unified Model for Visual Text Generation and Editing
-
Jul. 2026
Boogu-Image-0.1
Boogu Team,Huawei
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and Generation
Jul. 2026
SciForma
Microsoft & Peking University
SciForma: Structure-Faithful Generation of Scientific Diagrams
Jul. 2026
VecFontLLM
Fuzhou University & Peking University
VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts
-
Jul. 2026
ArtChart
Ant Group
ArtChart: A Benchmark for Faithful Artistic Chart Generation with Integrated Text Rendering
-
Jul. 2026
DataEvolver
CSU
DataEvolver: Self-Evolving Multi-Agent Data Construction for Text-Rich Image Generation
Jul. 2026
Qwen-Image-2.0-RL
Alibaba
Qwen-Image-2.0-RL Technical Report
-
Jun. 2026
UniTranslator
IIE CAS
UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation
Jun. 2026
SteerVTE
ByteDance & Peking University
SteerVTE: Seamless Video Text Editing with Style and Glyph Control
-
Jun. 2026
DiffMath
SCUT & Huawei
DiffMath: Symbol- and Graph-Aware Latent Diffusion Transformer for Handwritten Mathematical Expression Generation
Jun. 2026
PhyDrawGen
University of Dhaka
PhyDrawGen: Physically Grounded Diagram Generation from Natural Language
-
Jun. 2026
NIV
Reichman University
NIV: Neural Axis Variations for Variable Font Generation
Jun. 2026
Qwen-Image-2.0
Alibaba Group
Qwen-Image-2.0 Technical Report
May. 2026
MangaFlow
The University of Tokyo
MangaFlow: An End-to-End Agentic Framework for Controllable Story to Manga Generation
-
May. 2026
Wan-Image
Alibaba Group
Wan-Image: Pushing the Boundaries of Generative Visual Intelligence
-
Apr. 2026
PosterIQ
PolyU
PosterIQ: A Design Perspective Benchmark for Poster Understanding and Generation
Mar. 2026
EfficientPosterGen
Tsinghua University
EfficientPosterGen: Semantic-aware Efficient Poster Generation via Token Compression and Accurate Violation Detection
Mar. 2026
TextFlow
NJUST
Towards Training-Free Scene Text Editing
Mar. 2026
GlyphPrinter
Fudan University
GlyphPrinter: Region-Grouped Direct Preference Optimization for Glyph-Accurate Visual Text Rendering
Mar. 2026
CTRL-S
SJTU
Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning
-
Mar. 2026
LaDe
Adobe Research
LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition
-
Mar. 2026
EchoGen
USTC
EchoGen: Cycle-Consistent Learning for Unified Layout-Image Generation and Understanding
-
Mar. 2026
WebVR
StepFun
WebVR: Benchmarking Multimodal LLMs for WebPage Recreation from Videos via Human-Aligned Visual Rubrics
Beyond general document parsing and understanding, traditional OCR research remains essential for specialized visual-text structures, restoration, temporal analysis, and forensic reliability.
📄 Document Dewarping
Document dewarping restores photographed or scanned pages to a geometrically rectified and readable form.
Venue
Name
Primary affiliation
Title
GitHub
Date
BookNet
HFUT
BookNet: Dual-Page Book Image Rectification via Cross-Page Attention
-
Jan. 2026
TADoc
CAS
TADoc: Robust Time-Aware Document Image Dewarping
-
Aug. 2025
DocDewarpHV
HIT
Dual Dimensions Geometric Representation Learning Based Document Dewarping
Jul. 2025
DocMatcher
FZI & KIT
DocMatcher: Document Image Dewarping via Structural and Textual Line Matching
Mar. 2025
-
Shuya Branch of the Ivanovo State University
Efficient Document Image Dewarping via Hybrid Deep Learning and Cubic Polynomial Geometry Restoration
Jan. 2025
DocScanner
USTC
DocScanner: Robust Document Image Rectification with Progressive Learning
Jan. 2025
DocRes
SCUT
DocRes: A Generalist Model Toward Unifying Document Image Restoration Tasks
Jun. 2024
DocNLC
SCUT
DocNLC: A Document Image Enhancement Framework with Normalized and Latent Contrastive Representation for Multiple Degradations
Feb. 2024
DocTr++
USTC
Deep Unrestricted Document Image Rectification
-
2024
LA-DocFlatten
CAS
Layout-aware Single-image Document Flattening
2024
UVDoc
ETH Zurich
UVDoc: Neural Grid-based Document Unwarping
Oct. 2023
Foreground and Text-lines Aware Model
HIT Shenzhen, China
Foreground and text-lines aware document image rectification
Jun. 2023
DocMAE
USTC & iFLYTEK
DocMAE: Document Image Rectification via Self-supervised Representation Learning
-
2023
Marior
SCUT & IntSig
Marior: Margin Removal and Iterative Content Rectification for Document Dewarping in the Wild
Oct. 2022
📄 Physical Structure Analysis
Physical structure analysis identifies document regions, layouts, and spatial relationships before semantic reasoning.
Venue
Name
Primary affiliation
Title
GitHub
Date
PorTEXTO
NOVA School of Science and Technology
PorTEXTO: A European Portuguese Benchmark for Visual Text Extraction
-
Jun. 2026
-
Insiders Technologies GmbH
Bounding Box Label Propagation for Re-Annotation of Document Layout Analysis Datasets
-
Jun. 2026
IndustryBench-MIPU
Multimodal and Industrial AI Team, Alibaba
IndustryBench-MIPU: Benchmarking Multi-Image Attribute Value Extraction for Industrial Products
Jun. 2026
ERN-Net
Tamkang University
ERN-Net : Evolving Reason Node-Net for Document Binarization
-
Jun. 2026
HiLEx
IEM Kolkata
HiLEx: Image-Based Hierarchical Layout Extraction from Question Papers
Mar. 2025
DCEM-ViT
Sharda University, Greater Noida, India
Devanagari character encoded mix-merge vision transformer for robust document layout analysis
---
Mar. 2025
Efficient Additive Attention DLA
Technical University of Kaiserslautern, Germany
Efficient Additive Attention for Transformer-based Semi-supervised Document Layout Analysis
---
Feb. 2025
DocSemi
Technical University of Kaiserslautern, Germany
DocSemi: Efficient Document Layout Analysis with Guided Queries
---
Feb. 2025
FS-QCSNet
China University of Mining and Technology
Few-Shot Quaternion-valued Correlation Squeeze Network for Document Image Layout Segmentation
---
Jan. 2025
LayoutDETR
Salesforce Research
LayoutDETR: Detection Transformer Is a Good Multimodal Layout Designer
-
Sep. 2024
LayoutLLM
Alibaba Group
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
Jun. 2024
RoDLA
KIT & Univ. of Oxford
RoDLA: Benchmarking the Robustness of Document Layout Analysis Models
Jun. 2024
DocLLM
JPMorgan Chase & Co.
DocLLM: A Layout-Aware Generative Language Model for Multimodal Document Understanding
May 2024
SemiDocSeg
Computer Vision Center, Barcelona, Spain
SemiDocSeg: Harnessing Semi-Supervised Learning for Document Layout Analysis
---
Mar. 2024
VGT
Alibaba Group
Vision Grid Transformer for Document Layout Analysis
Oct. 2023
GeoLayoutLM
Alibaba Group
GeoLayoutLM: Geometric Pre-training for Visual Information Extraction
Jun. 2023
M6Doc
SCUT
M6Doc: A Large-Scale Multi-Format, Multi-Type, Multi-Layout, Multi-Language, Multi-Annotation Category Dataset for Modern Document Layout Analysis
Jun. 2023
HRDoc
USTC & iFLYTEK
HRDoc: Dataset and Baseline Method Toward Hierarchical Reconstruction of Document Structures
Feb. 2023
LayoutLMv3
Microsoft
LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking
Oct. 2022
📄 Reading Order Prediction
Reading order prediction recovers the intended sequence of text and visual elements in complex page layouts.
Venue
Name
Primary affiliation
Title
GitHub
Date
Orli
University of Konstanz
End-to-End Text Line Detection and Ordering
Jun. 2026
FocalOrder
Unisound AI Technology Co. Ltd.
FocalOrder: Focal Preference Optimization for Reading Order Detection
-
Jan. 2026
ROAP
UESTC
ROAP: A Reading-Order and Attention-Prior Pipeline for Optimizing Layout Transformers in Key Information Extraction
Jan. 2026
XY-cut++
Tianjin University
XY-Cut++: Advanced Layout Ordering via Hierarchical Mask Mechanism on a Novel Benchmark
-
Apr. 2025
UniHDSA
USTC & Microsoft Research Asia
UniHDSA: A Unified Relation Prediction Approach for Hierarchical Document Structure Analysis
2025
HanDoc-OrderOCR
NCCU & Academia Sinica
Reading between the Lines: Image-Based Order Detection in OCR for Chinese Historical Documents
-
Feb. 2024
Detect-Order-Construct
USTC & Microsoft Research Asia
Detect-Order-Construct: A Tree Construction Based Approach for Hierarchical Document Structure Analysis
2024
Reading Order Matters
Fudan University
Reading Order Matters: Information Extraction from Visually-rich Documents by Token Path Prediction
Dec. 2023
LayoutLMv3
SYSU
LayoutLMv3: Pre-training for Document AI with Unified Text and Image Masking
Oct. 2022
📄 Mathematical Expression Recognition
Mathematical expression recognition converts printed or handwritten formulas into structured symbolic representations.
Venue
Name
Primary affiliation
Title
GitHub
Date
-
University of Alicante
Direct content-based retrieval from music scores images
-
May. 2026
MusicSynth
-
MusicSynth: An Automated Pipeline for Generating Violin Fingerboard Animations from Sheet Music Using Optical Music Recognition
-
May. 2026
Transcoda
Heinrich Heine University Düsseldorf
Transcoda: End-to-End Zero-Shot Optical Music Recognition via Data-Centric Synthetic Training
May. 2026
From Image to Music Language
FindLab
From Image to Music Language: A Two-Stage Structure Decoding Approach for Complex Polyphonic OMR
-
Apr. 2026
UniMERNet
OpenDataLab & Shanghai AI Lab
UniMERNet: A Universal Network for Real-World Mathematical Expression Recognition
Jun. 2025
CDM
OpenDataLab
Image Over Text: Transforming Formula Recognition Evaluation with Character Detection Matching
Jun. 2025
SSAN
Inner Mongolia University
SSAN: A Symbol Spatial-Aware Network for Handwritten Mathematical Expression Recognition
Apr. 2025
TAMER
Peking University
TAMER: Tree-Aware Transformer for Handwritten Mathematical Expression Recognition
Apr. 2025
VLPG
UCAS
Vision–language pre-training for graph-based handwritten mathematical expression recognition
Jan. 2025
BAT
USTC & iFLYTEK
Bidirectional Trained Tree-Structured Decoder for Handwritten Mathematical Expression Recognition
2025
LattE
Purdue University
LattE: Improving LaTeX Recognition with Iterative Refinement
Sep. 2024
-
TUAT & VGU & RIT & Nantes Univ.
A Survey on Handwritten Mathematical Expression Recognition: The Rise of Encoder-Decoder and GNN Models
-
Sep. 2024
NAMER
USTC & iFLYTEK Research
NAMER: Non-Autoregressive Modeling for Handwritten Mathematical Expression Recognition
-
Sep. 2024
HMEG
Hangzhou Dianzi Univ.
Generating Handwritten Mathematical Expressions from Symbol Graphs: An End-to-End Pipeline
-
Jun. 2024
BPD
SCUT
A Tree-Based Model with Branch Parallel Decoding for Handwritten Mathematical Expression Recognition
-
2024
SAN (Syntax-Aware Net)
Tomorrow Advancing Life
Syntax-Aware Network for Handwritten Mathematical Expression Recognition
Jun. 2022
📄 Table & Chart Understanding
Table and chart understanding covers structure recognition, data extraction, grounding, retrieval, and visual reasoning over structured graphics.
Venue
Name
Primary affiliation
Title
GitHub
Date
-
Teamreboott Inc.
Rethinking the Pointer Loss in Table Structure Recognition: Geometry-Aware Pointer Loss for Spatial Locality
Jun. 2026
-
Preferred Networks, Inc.
Revisiting Structural Dependency in Autoregressive Multi-Task Table Recognition via Order-Independent Cell-Level Representations
-
Jun. 2026
ChartLens
Shandong University
ChartLens: A Dual-Branch Framework for Chart Data Correction and Factual Summary Refinement
Jun. 2026
POTATR
Kensho Technologies (S&P Global)
POTATR: A Lightweight Image-to-Graph Model for Page-Level Table Extraction
-
Jun. 2026
ChartReLA
University of Science, Ho Chi Minh city, Vietnam
ChartReLA: A compact vision-language model for comprehensivechart reasoning via relationship modeling
Jan. 2026
Table-R1
XJTU-Liverpool University
Can GRPO Boost Complex Multimodal Table Understanding?
-
Dec. 2025
TinyChart
Alibaba & Tsinghua
TinyChart: Efficient Chart Understanding with Program-of-Thoughts Learning and Visual Token Merging
-
Nov. 2024
ReachQA
Fudan University
Distill Visual Chart Reasoning Ability from LLMs to MLLMs
Oct. 2024
OmniParser
Alibaba Group
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
Jun. 2024
DePlot
Google
DePlot: One-shot visual language reasoning by plot-to-table translation
Jul. 2023
TableVLM
Fudan University
TableVLM: Multi-modal Pre-training for Table Structure Recognition
-
Jul. 2023
VAST
Huawei
Improving Table Structure Recognition with Visual-Alignment Sequential Coordinate Modeling
-
Jun. 2023
LORE
Alibaba Group
LORE: Logical Location Regression Network for Table Structure Recognition
Feb. 2023
ChartQA
York University
ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning
Jul. 2022
LGPMA
Hikvision
LGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask Alignment
Sep. 2021
📄 Scene Text Understanding
Scene text understanding unifies text detection, recognition, and spotting in natural images and related real-world settings.
Venue
Name
Primary affiliation
Title
GitHub
Date
Next-Generation Parallel Decoder for LPDR
NUTECH
Next-Generation Parallel Decoder for LPDR: Architectural Optimization and Class-Balanced GAN-Augmentation
-
Jun. 2026
-
Polytechnic University of Turin
Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting
-
May. 2026
MNSP
Nankai University
Masked Next-Scale Prediction for Self-supervised Scene Text Recognition
May. 2026
-
Afeka Academic College of Engineering
Mapping License Plate Recoverability Under Extreme Viewing Angles for Oppor-tunistic Urban Sensing
-
Apr. 2026
DPText-DETR
Wuhan Univ.
DPText-DETR: Towards Better Scene Text Detection with Dynamic Points in Transformer
Feb. 2023
DeepSolo
Wuhan University
DeepSolo: Let Transformer Decoder with Explicit Points Solo for Text Spotting
Nov. 2022
ABINet++
USTC
ABINet++: Autonomous, Bidirectional and Iterative Language Modeling for Scene Text Spotting
Nov. 2022
SwinTextSpotter
SCUT
SwinTextSpotter: Scene Text Spotting via Better Synergy between Text Detection and Text Recognition
Mar. 2022
ABCNet v2
SCUT
ABCNet v2: Adaptive Bezier-Curve Network for Real-time End-to-end Text Spotting
May. 2021
PAN++
Nanjing University
PAN++: Towards Efficient and Accurate End-to-End Spotting of Arbitrarily-Shaped Text
May. 2021
MANGO
Hikvision Research Institute
MANGO: A Mask Attention Guided One-Stage Scene Text Spotter
Dec. 2020
Mask TextSpotter v3
HUST
Mask TextSpotter v3: Segmentation Proposal Network for Robust Scene Text Spotting
Jul. 2020
Text perceptron
Hikvision Research Institute
Text perceptron: Towards end-to-end arbitrary-shaped text spotting
Apr. 2020
ABCNet
SCUT
ABCNet: Real-time Scene Text Spotting with Adaptive Bezier-Curve Network
Feb. 2020
📄 Text Removal & Editing
Text removal and editing modifies textual content in images while preserving visual consistency and surrounding appearance.
Venue
Name
Primary affiliation
Title
GitHub
Date
ProductConsistency
Fractal Analytics
ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL
Jun. 2026
-
Fudan University
Unified Multimodal Autoregressive Modeling with Shared Context-Visual Tokenizer is Key to Unification
-
Jun. 2026
UniDDT
Nanjing University
UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer
-
Jun. 2026
TextWand
Peking University
TextWand: A Unified Framework for Scene Text Editing
-
Jun. 2026
TMIM
USTC
Leveraging Text Localization for Scene Text Removal via Text-Aware Masked Image Modeling
Sep. 2024
PowerPaint
Tsinghua & Shanghai AI Lab
PowerPaint: A Task is Worth One Word — Learning with Task Prompts for High-Quality Versatile Image Inpainting
Sep. 2024
MagicEraser
Huawei & SIAT, CAS
MagicEraser: Erasing Any Objects via Semantics-Aware Control
-
Sep. 2024
TurboEdit
Adobe
TurboEdit: Instant Text-based Image Editing
Sep. 2024
SPDInv
HKUST
Source Prompt Disentangled Inversion for Boosting Image Editability
Sep. 2024
DARLING
USTC
Choose What You Need: Disentangled Representation Learning for Scene Text Recognition, Removal and Editing
-
Jun. 2024
SceneTextGen
Meta & Rutgers
Layout-Agnostic Scene Text Image Synthesis with Diffusion Models
-
Jun. 2024
-
KAIST
Prompt Augmentation for Self-supervised Text-guided Image Manipulation
-
Jun. 2024
ViTEraser
SCUT
ViTEraser: Harnessing the Power of Vision Transformers for Scene Text Removal with SegMIM Pretraining
Feb. 2024
FETNet
Kyushu Univ.
FETNet: Feature Erasing and Transferring Network for Scene Text Removal
2023
📄 Text Image Super-Resolution
Text image super-resolution restores low-resolution text regions while preserving character identity and legibility.
Venue
Name
Primary affiliation
Title
GitHub
Date
FDF
Anhui University
Frequency Decoupled Framework for Screen Content Image Super-Resolution
-
Jun. 2026
DTG-Restore
Virginia Tech
DTG-Restore: Training-Free Diffusion Refinement for Generative Video Super-Resolution
-
Jun. 2026
Everything at Every Scale
MIT
Everything at Every Scale: Scale-Invariant Diffusion with Continuous Super-Resolution
-
May. 2026
PRISM
SJTU
PRISM: Prior Rectification and Uncertainty-Aware Structure Modeling for Diffusion-Based Text Image Super-Resolution
May. 2026
TextDiff
BUPT
TextDiff: Mask-Guided Residual Diffusion Models for Scene Text Image Super-Resolution
-
2025
PEAN
Southeast Univ.
PEAN: A Diffusion-Based Prior-Enhanced Attention Network for Scene Text Image Super-Resolution
Oct. 2024
DCDM
IIT Roorkee
DCDM: Diffusion-Conditioned-Diffusion Model for Scene Text Image Super-Resolution
Sep. 2024
DiffTSR
BIT & SenseTime
Diffusion-based Blind Text Image Super-Resolution
Jun. 2024
SGENet
Fudan Univ. & Videt Tech.
SGENet: Efficient Scene Text Image Super-Resolution with Semantic Guidance
-
Apr. 2024
STIRER
Tongji Univ. & Fudan Univ.
STIRER: A Unified Model for Low-Resolution Scene Text Image Recovery and Recognition
Oct. 2023
DocDiff
BUPT
DocDiff: Document Enhancement via Residual Diffusion Models
Oct. 2023
-
HIT & NTU
Learning Generative Structure Prior for Blind Text Image Super-Resolution
Jun. 2023
DPMN
Southeast Univ.
DPMN: Improving Scene Text Image Super-Resolution via Dual Prior Modulation Network
Feb. 2023
TPGSR
Hong Kong PolyU
Text Prior Guided Scene Text Image Super-Resolution
Benchmarks play a critical role in shaping the evolution of OCR in the LLM era.
Venue
Benchmark Name
Description
Link
Date
ConfBench
The first calibration-specific benchmark for key information extraction (KIE), built by applying 20 controlled degradation pipelines to a diverse document set.
Aug. 2026
VTC-Eval
Reveals that existing VTC evaluation protocols relying on downstream task performance fail to measure text preservation fidelity due to strong MLLM linguistic priors, and introduces a decoupled evaluation framework that isolates semantic retention from visual encoding quality.
-
Aug. 2026
Evidence-Risk Audit
Shows that correct answers can survive even when no retained token is traceable to the supporting OCR region, and proposes an evidence-risk audit coupling answer behavior with geometric token-origin provenance to catch this blind spot in token pruning evaluation.
Aug. 2026
LongChart Bench
A new pipeline and benchmark designed to evaluate MLLMs’ visual reasoning and performance in multi-chart settings with complex computational relationships.
-
Aug. 2026
XL-DocBench
A fully human-verified benchmark for extra-long document understanding, with 1,519 retained questions from six professional domains and contexts up to 2,303 pages.
-
Aug. 2026
ExtractBench
The first benchmark for schema-guided enterprise document extraction that jointly scores value accuracy, record completeness at scale, grounding, and measured cost.
Aug. 2026
FaithC4
A controlled multilingual perturbation benchmark for measuring transcription faithfulness in VLMs, and use it to evaluate 15 systems across English, Chinese, and Korean.
-
Jul. 2026
GDP.pdf
A benchmark for multimodal reasoning grounded in professional PDF documents, built from expert-authored tasks with the original files and their domain semantics intact.
Jul. 2026
SynthDocBench
A long-context visual document understanding benchmark, measuring VLM performance for the ability to locate multiple key information facts over long-contexts from a given document to reason and answer a multi-step question.
-
Jul. 2026
WILDTRACE
A source-internal long-context multi-hop reasoning benchmark built from natural evidence trails.481 tasks over 214 naturally occurring long-form sources (incident reports, literary narratives) with 7 source-internal evidence geometries
Jul. 2026
MORE
A comprehensive multilingual document parsing benchmark covering diverse scripts and layouts.
Jul. 2026
ClinOCR-Bench
The first public clinical OCR benchmark with 384 scanned medical documents across 6 artifact conditions (normal, handwriting, poor quality, rotation, tables, mixed).
Jul. 2026
HCSU
A fine-grained benchmark for evaluating LVLMs on historical calligraphy style perception, addressing a critical gap in cultural heritage AI with hierarchical style annotations across multiple calligraphy traditions.
Jul. 2026
PosterHarness
An auditable harness that evaluates text-rich image models on scientific poster generation by checking legibility, aspect ratios, and hallucinated scientific figures.
-
Jul. 2026
—
DocuBench
A schema-guided structured extraction benchmark of 50 hard real-world documents spanning 10 file types and 11 languages (including RTL and CJK scripts), with hand-verified JSON labels, an open scorer, and committed per-document baseline outputs from six systems.
Jul. 2026
S-OBI
The first benchmark for sentence-level oracle bone inscription understanding with 695 QA pairs; evaluates MLLMs beyond isolated character recognition.
Jul. 2026
OCR-Robust
First systematic benchmark for evaluating VLM OCR reasoning robustness under visual perturbations.
Jun. 2026
Invoice Haystack
A benchmark for visually homogeneous document retrieval targeting invoice embedding collapse analysis.
Jun. 2026
AGORA
A benchmark for agentic reasoning over large-scale workplace document archives.
-
Jun. 2026
PuMVR
A parallel-script benchmark isolating orthography to evaluate true multilingual capability in Vision-Language Models.
Jun. 2026
TableVision
A large-scale benchmark for spatially grounded reasoning over complex hierarchical tables, coupling multi-step table reasoning with pixel-accurate grounding trajectories.
-
Apr. 2026
JaWildText
A diagnostic benchmark for Japanese scene text understanding covering STVQA, receipt KIE, and handwriting OCR with script-aware evaluation.
-
Mar. 2026
MDPBench
A multilingual benchmark for document parsing across digital and photographed documents in 17 languages, exposing robustness gaps on non-Latin scripts and real-world captures.
Mar. 2026
Wild-OmniDocBench
A real-world captured document parsing benchmark built to stress robustness under casual capture, distortion, and non-standard document conditions.
-
Mar. 2026
DISCO
A comparative evaluation suite for document intelligence systems that separates OCR parsing quality from downstream question answering across diverse document types.
-
Mar. 2026
SEA-Vision
A multilingual benchmark for document and scene text understanding in Southeast Asia.
-
Mar. 2026
VAREX
A benchmark for multi-modal structured extraction from documents.
Mar. 2026
COTe
A decomposable evaluation framework for document layout analysis models.
-
Mar. 2026
Real5-OmniDocBench
A full-scale physical reconstruction benchmark for robust document parsing in the wild.
Mar. 2026
DTBench
A synthetic benchmark for document-to-table extraction.
Feb. 2026
ExtractBench
A benchmark and evaluation methodology for complex structured extraction from documents.
We welcome contributions from the community and encourage pull requests to help keep this project up to date. Suggestions, feedback, and corrections are always welcome — please feel free to share them anytime!