Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
YomiTokuはAIを活用した日本語文書解析エンジンを提供するPythonパッケージです。 Yomitoku is an AI-powered document image analysis package designed specifically for the Japanese language.
| Date | Stars |
|---|---|
| 2026-07-24 | 1551 |
| 2026-07-25 | 1551 |
| 2026-07-28 | 1551 |
| 2026-07-30 | 1551 |
| 2026-08-06 | 1551 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
35.0
growth rate 0.00%/day
日本語版 | [English](README_EN.md)
<img src="static/logo/horizontal.png" width="800px">




[](https://kotaro-kinoshita.github.io/yomitoku/)
[](https://pepy.tech/projects/yomitoku)
[](https://yomitoku-studio.mlism.com)
> 🌐 **インストール不要でブラウザから試せます → [YomiToku Studio](https://yomitoku-studio.mlism.com)**
> 推論はすべてブラウザ内(WebAssembly / WebGPU)で実行され、**画像はどこにも送信されません**。まずは手元の画像で精度を確かめてみてください。
## 🌟 概要
YomiToku は日本語に特化した AI 文章画像解析エンジン(Document AI)です。画像内の文字の全文 OCR およびレイアウト解析機能を有しており、画像内の文字情報や図表を認識、抽出、変換します。
- 🤖 日本語データセットで学習した 4 種類(文字位置の検知、文字列認識、レイアウト解析、表の構造認識)の AI モデルを搭載しています。4 種類のモデルはすべて独自に学習されたモデルで日本語文書に対して、高精度に推論可能です。
- 🇯🇵 各モデルは日本語の文書画像に特化して学習されており、7000 文字を超える日本語文字の認識をサポート、手書き文字、縦書きなど日本語特有のレイアウト構造の文書画像の解析も可能です。(日本語以外にも英語の文書に対しても対応しています)。
- 📈 レイアウト解析、表の構造解析, 読み順推定機能により、文書画像のレイアウトの意味的構造を壊さずに情報を抽出することが可能です。
- 📄 多様な出力形式をサポートしています。html やマークダウン、json、csv のいずれかのフォーマットに変換可能です。また、文書内に含まれる図表、画像の抽出の出力も可能です。文書画像をサーチャブルPDFに変換する処理もサポートしています。
- ⚡ GPU 環境で高速に動作し、効率的に文書の文字起こし解析が可能です。また、VRAM も 8GB 以内で動作し、ハイエンドな GPU を用意する必要はありません。軽量モデルを用いれば CPU でも高速に推論が可能です。
## 🖼️ デモ
インストール前に、ブラウザ版 **[YomiToku Studio](https://yomitoku-studio.mlism.com)** で手元の画像を試せます(画像は外部送信されません)。
[gallery.md](gallery.md)にも複数種類の画像の検証結果を掲載しています。
| 入力画像 | OCR の結果 |
| :--------------------------------------------------------: | :-----------------------------------------------------: |
| <img src="static/in/demo.jpg" width="400px"> | <img src="static/out/in_demo_p1_ocr.jpg" width="400px"> |
| レイアウト解析の結果 | エクスポート<br>(HTML で出力したものをスクショ) |
| <img src="static/out/in_demo_p1_layout.jpg" width="400px"> | <img src="static/out/demo_html.png" width="400px"> |
Markdown でエクスポートした結果は関してはリポジトリ内の[static/out/in_demo_p1.md](static/out/in_demo_p1.md)を参照
- `赤枠` : 図、画像等の位置
- `緑枠` : 表領域全体の位置
- `ピンク枠` : 表のセル構造(セル上の文字は [行番号, 列番号] (rowspan x colspan)を表します)
- `青枠` : 段落、テキストグループ領域
- `赤矢印` : 読み順推定の結果
画像の出典:[「令和 6 年版情報通信白書 3 章 2 節 AI の進化に伴い発展するテクノロジー」](https://www.soumu.go.jp/johotsusintokei/whitepaper/ja/r06/pdf/n1410000.pdf):(総務省) を加工して作成
## 📣 リリース情報
- 2026 年 7 月 15 日 軽量モデル(`--lite`)が手書き文字の読み取りに対応し、1 行あたりの最大文字列長を 100 文字に拡張
- 2025 年 11 月 5 日 YomiToku v0.10.1 CPU推論向けに最適化したGPU Free OCRモデルのサポート
- 2025 年 4 月 4 日 YomiToku v0.8.0 手書き文字認識のサポート
- 2024 年 11 月 26 日 YomiToku v0.5.1 (beta) を公開
## 💡 インストールの方法
```bash
pip install yomitoku
```
- PyTorch はご自身の CUDA のバージョンにあったものをインストールしてください。デフォルトでは CUDA12.4 以上に対応したものがインストールされます。
- PyTorch は 2.5 以上のバージョンに対応しています。その関係で CUDA11.8 以上のバージョンが必要になります。対応できない場合は、リポジトリ内の Dockerfile を利用してください。
## 🚀 実行方法
### 通常モデルでの推論
```bash
yomitoku ${path_data} -f md -o results -v --figure
```
### 軽量モデルでの推論
`--lite`オプションを使用してください。
```bash
yomitoku ${path_data} -f md --lite -d cpu -o results -v --figure
```
#### Python API から軽量モードを利用する
CLI の `--lite` オプションに相当する軽量モードは、`configs` でテキスト認識モデルに `parseq-tiny-dynw-v4` を指定し、`dynamic_width` と `batch_bucketing` を有効化することで Python API からも利用できます。CPU 環境ではテキスト検出を ONNX 推論にすると、さらに高速化できます。
```python
import cv2
from yomitoku import DocumentAnalyzer
if __name__ == "__main__":
configs = {
"ocr": {
"text_recognizer": {
"model_name": "parseq-tiny-dynw-v4", # 動的幅対応の軽量モデル
"dynamic_width": True, # 切り出し画像を実際の幅で処理
"batch_bucketing": True, # 幅の近い画像をまとめてバッチ化
Excerpt of 8,822 characters
Read on GitHub892
48
10
Naoya Muramatsu · University of Cape Town · South Africa
2
2
1
Would you bet a product on this? Bounded 0–100 and slow moving.
matched fp:20ff105995a77967, topic:deep-learning, topic:pytorch
matched fp:20ff105995a77967, topic:ocr, readme:ocr