Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
👀「大模型」2小时从0训练65M参数的视觉多模态VLM!Train a 65M-parameter VLM from scratch in just 2h!
| Date | Stars |
|---|---|
| 2026-07-24 | 8361 |
| 2026-07-25 | 8365 |
| 2026-07-28 | 8382 |
| 2026-07-30 | 8382 |
| 2026-08-06 | 8382 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
0.0
growth rate 0.00%/day
<div align="center">

</div>
<div align="center">

[](https://github.com/jingyaogong/minimind-v/stargazers)
[](LICENSE)
[](https://github.com/jingyaogong/minimind-v/commits/master)
[](https://github.com/jingyaogong/minimind-v/pulls)
[](https://huggingface.co/collections/jingyaogong/minimind-v-67000833fb60b3a2e1f3597d)
</div>
<div align="center">

</div>
<div align="center">
<h3>"大道至简"</h3>
</div>
<div align="center">
中文 | [English](./README_en.md)
</div>
* 此项目旨在从0开始,仅用3块钱成本 + 2小时!即可训练出65M参数的超小多模态视觉语言模型**MiniMind-V**。
* **MiniMind-V**最小版本体积仅为 GPT3 的约 $\frac{1}{2600}$,力求做到个人GPU也可快速推理甚至训练。
* **MiniMind-V**是[MiniMind](https://github.com/jingyaogong/minimind)纯语言模型的视觉能力额外拓展,同系列多模态Omni模型详见[MiniMind-O](https://github.com/jingyaogong/minimind-o)。
* 项目同时包含了VLM大模型的极简结构、数据集清洗、Pretrain、SFT等全过程代码。
* 这不仅是一个开源VLM模型的最小实现,也是入门视觉语言模型的简明教程。
* 希望此项目能为所有人提供一个抛砖引玉的示例,一起感受创造的乐趣!推动更广泛AI社区的进步!
> 注:本项目基于 Apache 2.0 协议开源,完全免费。“2 小时” 指 SFT 阶段在单张 NVIDIA 3090 上跑完 `1 epoch` 的实测耗时,“3 块钱” 指对应时段的 GPU 租用成本。
<div align="center">

[🔗🤖在线体验](https://www.modelscope.cn/studios/gongjy/MiniMind-V) | [🔗🎞️视频介绍](https://www.bilibili.com/video/BV1Sh1vYBEzY)
</div>
# 📌 项目介绍
“用乐高拼出一架飞机,远比坐在头等舱里飞行更让人兴奋!”
构建VLM范式的多模态大模型是否真的如想象中那样复杂?它的代码实现到底如何?
训练过程究竟难不难?那么现在,探索它们的答案,一起感受创造的乐趣吧!
> [!TIP]
> (截至2026-04-20)MiniMind-V 系列已完成了以下型号模型训练,最小仅需65M (0.065B),即可具备识图和对话的能力!
| 模型 | 参数量 | Release |
|---|---|---|
| minimind-3v-moe | 200M-A65M | 2026.04.20 |
| minimind-3v | 65M | 2026.04.20 |
| MiniMind2-V | 104M | 2025.02.20 |
| MiniMind2-Small-V | 26M | 2025.02.20 |
| minimind-v-v1-small | 27M | 2024.10.04 |
| minimind-v-v1 | 109M | 2024.10.04 |
#### 👉 更新日志
<details>
<summary> <b>2026-04-20</b> </summary>
- 更新模型检查点:minimind-3v (65M) / minimind-3v-moe (200M-A65M)
- Projector 更新:添加 `LayerNorm`,去掉 reshape token 合并(P32 原生 64 token,无需下采样)
- Vision Encoder 换为 `SiglipVisionModel`(P32,固定 256×256)
- 训练数据切到 ALLaVA-4V(Pretrain 127 万 / SFT 290 万,已合并为单阶段 SFT)
- Freeze 策略更新:`freeze_llm=1` 解冻首末两层,Pretrain/SFT 默认改为 `2`/`1`;`max_seq_len` 360 → 450
- 其他 bugfix 与小调整
</details>
<details>
<summary> <b>2026-04-01</b> </summary>
- 新增 minimind-3v (67M) 和 minimind-3v-moe (201M-A67M) 模型
- 统一使用768+8架构,支持dense和moe两种模式
- 视觉编码器从CLIP切换为SigLIP2(siglip2-base-p16-256-ve)
- 投影模块从QFormer改为MLP Projection + reshape压缩
- 数据集格式更新为parquet,混合数据源、更新tokenizer,图像占位符改为`<|image_pad|>`、新增WebUI:支持动态扫描模型目录、下拉菜单切换模型
- 模型代码重构,LLM/VLM统一适配Transformers格式
- 训练脚本支持DDP多卡、bfloat16混合精度、torch.compile加速
</details>
<details>
<summary> <b>2025-10-24</b> </summary>
- bug修复:模型权重不对应
- 适配[「minimind-1024更新」](https://github.com/jingyaogong/minimind)
- 代码重构:训练和评估脚本规范化
- 新增完整的断点续训支持
</details>
<details>
<summary> <b>More...</b> </summary>
**2025-04-27**
- 兼容性更新
- 适配[「minimind仓库新特性」](https://github.com/jingyaogong/minimind/issues/370)
- 规范化部分代码
**2025-02-20**
- MiniMind2-V伴随MiniMind2同步更新
- 大幅减少所有冗余代码,规范代码格式
- 大幅精简模型冗余结构
- 更新数据集格式,拓展新的SFT数据集
- 比前代VLM更优秀的效果!
**2024-10-05**
- MiniMind-V如期而至,首次开源
</details>
# 📌 快速开始
<details>
<summary>分享本人的软硬件配置(仅供参考)</summary>
* CPU: Intel(R) Core(TM) i9-10980XE CPU @ 3.00GHz
* RAM: 128 GB
* GPU: NVIDIA GeForce RTX 3090(24GB) * 8
* Ubuntu==20.04
* CUDA==12.2
* Python==3.10
* [requirements.txt](./requirements.txt)
</details>
## 第0步(必须)
### 1' 环境准备
```bash
# 克隆仓库代码
git clone --depth 1 https://github.com/jingyaogong/minimind-v
# 安装必要依赖
pip install -r requirements.txt -i Excerpt of 24,311 characters
Read on GitHubjingyaogong · NJU · China
124
33
2
Wuya
2
1
Would you bet a product on this? Bounded 0–100 and slow moving.
matched fp:f5f9786875ab18ce, topic:vision-language-model
matched fp:f5f9786875ab18ce, topic:chatgpt