Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
MiniRBT (中文小型预训练模型系列)
| Date | Stars |
|---|---|
| 2026-07-24 | 303 |
| 2026-07-25 | 303 |
| 2026-07-28 | 303 |
| 2026-07-30 | 303 |
| 2026-08-06 | 303 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
0.0
growth rate 0.00%/day
[**中文说明**](https://github.com/iflytek/minirbt) | [**English**](https://github.com/iflytek/minirbt/blob/main/README_EN.md)
<p align="center">
<br>
<img src="./pics/banner.png" width="600"/>
<br>
</p>
<p align="center">
<a href="https://github.com/ymcui/LERT/blob/main/LICENSE">
<img alt="GitHub" src="https://img.shields.io/github/license/iflytek/MiniRBT.svg?color=blue&style=flat-square">
</a>
</p>
在自然语言处理领域中,预训练语言模型(Pre-trained Language Models)已成为非常重要的基础技术。为了进一步促进中文信息处理的研究发展,哈工大讯飞联合实验室(HFL)基于自主研发的[知识蒸馏工具TextBrewer](https://github.com/airaria/TextBrewer),结合了全词掩码(Whole Word Masking)技术和知识蒸馏(Knowledge Distillation)技术推出中文小型预训练模型**MiniRBT**。
----
[中文LERT](https://github.com/ymcui/LERT) | [中英文PERT](https://github.com/ymcui/PERT) | [中文MacBERT](https://github.com/ymcui/MacBERT) | [中文ELECTRA](https://github.com/ymcui/Chinese-ELECTRA) | [中文XLNet](https://github.com/ymcui/Chinese-XLNet) | [中文BERT](https://github.com/ymcui/Chinese-BERT-wwm) | [知识蒸馏工具TextBrewer](https://github.com/airaria/TextBrewer) | [模型裁剪工具TextPruner](https://github.com/airaria/TextPruner)
查看更多哈工大讯飞联合实验室(HFL)发布的资源:https://github.com/iflytek/HFL-Anthology
## 内容导引
| 章节 | 描述 |
|-|-|
| [简介](#简介) | 介绍小型预训练模型所应用的技术方案 |
| [模型下载](#模型下载) | 提供了小型预训练模型的下载地址 |
| [快速加载](#快速加载) | 介绍了如何使用[🤗Transformers](https://github.com/huggingface/transformers)快速加载模型 |
| [模型对比](#模型对比) | 提供了本目录中模型的参数对比 |
| [蒸馏参数](#蒸馏设置) | 预训练蒸馏超参设置 |
| [中文基线系统效果](#中文基线系统效果) | 列举了部分中文基线系统效果 |
| [两段式蒸馏方法](#two-stage) | 列举了两段式蒸馏与一段式蒸馏的效果对比 |
| [预训练](#预训练) | 说明预训练代码的使用方法 |
| [使用建议](#使用建议) | 提供了若干使用中文小型预训练模型的建议 |
| [FAQ](#faq) | 常见问题答疑 |
| [引用](#引用) | 本项目的技术报告 |
| [参考文献](#参考文献) | 参考文献 |
## 简介
目前预训练模型存在参数量大,推理时间长,部署难度大的问题,为了减少模型参数及存储空间,加快推理速度,我们推出了实用性强、适用面广的中文小型预训练模型**MiniRBT**,我们采用了如下技术:
* **全词掩码技术**:全词掩码技术(Whole Word Masking)是预训练阶段的训练样本生成策略。简单来说,原有基于WordPiece的分词方式会把一个完整的词切分成若干个子词,在生成训练样本时,这些被分开的子词会随机被mask(替换成[MASK];保持原词汇;随机替换成另外一个词)。而在WWM中,如果一个完整的词的部分WordPiece子词被mask,则同属该词的其他部分也会被mask。更详细的说明及样例请参考:**[Chinese-BERT-wwm](https://github.com/ymcui/Chinese-BERT-wwm)**,本工作中我们使用[哈工大LTP](http://ltp.ai)作为分词工具。
* **两段式蒸馏**:相较于教师模型直接蒸馏到学生模型的传统方法,我们采用中间模型辅助教师模型到学生模型蒸馏的两段式蒸馏方法,即教师模型先蒸馏到助教模型(Teacher Assistant),学生模型通过对助教模型蒸馏得到,以此提升学生模型在下游任务的表现。并在下文中贴出了下游任务上两段式蒸馏与一段式蒸馏的实验对比,结果表明两段式蒸馏能取得相比一段式蒸馏更优的效果。
* **构建窄而深的学生模型**。相较于宽而浅的网络结构,如TinyBERT结构(4层,隐层维数312),我们构建了窄而深的网络结构作为学生模型MiniRBT(6层,隐层维数256和288),实验表明窄而深的结构下游任务表现更优异。
**MiniRBT**目前有两个分支模型,分别为**MiniRBT-H256**和**MiniRBT-H288**,表示隐层维数256和288,均为6层Transformer结构,由两段式蒸馏得到。同时为了方便实验效果对比,我们也提供了TinyBERT结构的**RBT4-H312**模型下载。
我们会在近期提供完整的技术报告,敬请期待。
## 模型下载
| 模型简称 | 层数 | 隐层大小 | 注意力头 | 参数量 | 🤗HF下载 | 百度盘下载 |
| :----------------------------- | :--: | :------: | :------: | :----: | :--------------------------------------------------: | :----------------------------------------------------------: |
| **MiniRBT-h288** | 6 | 288 | 8 | 12.3M | [[PyTorch]](https://huggingface.co/hfl/minirbt-h288) | [[PyTorch]](https://pan.baidu.com/s/1pIwzx0Zu62fLOSQASxTohQ?pwd=7313)<br/>(密码:7313) |
| **MiniRBT-h256** | 6 | 256 | 8 | 10.4M | [[PyTorch]](https://huggingface.co/hfl/minirbt-h256) | [[PyTorch]](https://pan.baidu.com/s/16ZMOoliMLsa2KqMKpwT0IA?pwd=iy53)<br/>(密码:iy53) |
| **RBT4-h312** (TinyBERT同大小) | 4 | 312 | 12 | 11.4M | [[PyTorch]](https://huggingface.co/hfl/rbt4-h312) | [[PyTorch]](https://pan.baidu.com/s/11I9ojsnGK-7eZXMkl1k7EQ?pwd=ssdw)<br/>(密码:ssdw) |
也可以直接通过huggingface官网下载模型(PyTorch & TF2):<https://huggingface.co/hfl>
下载方法:点击任意需要下载的模型 → 选择"Files and versions"选项卡 → 下载对应的模型文件。
## 快速加载
### 使用Huggingface-Transformers
依托于[🤗transformers库](https://github.com/huggingface/transformers),可轻松调用以上模型。
```python
from transformers import BertTokenizer, BertModel
tokenizer = BertTokenizer.from_pretraineExcerpt of 13,270 characters
Read on GitHubWould you bet a product on this? Bounded 0–100 and slow moving.
matched fp:daf5cd7f5458b24d, topic:pytorch, topic:tensorflow