Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
聚宝盆(Cornucopia): 中文金融系列开源可商用大模型,并提供一套高效轻量化的垂直领域LLM训练框架(Pretraining、SFT、RLHF、Quantize等)
| Date | Stars |
|---|---|
| 2026-07-24 | 659 |
| 2026-07-25 | 659 |
| 2026-07-28 | 659 |
| 2026-07-30 | 659 |
| 2026-07-31 | 659 |
| 2026-08-06 | 659 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
0.0
growth rate 0.00%/day
<div align=center>
<a href="https://github.com/jerry1993-tech/Cornucopia-LLaMA-Fin-Chinese/" target="_blank"><img src="assets/logo.png" alt="Cornucopia-LLaMa" style="width: 80%; min-width: 350px; display: block; margin: auto;"></a>
[](https://www.zhihu.com/people/xuyingjie521/columns) [](./) [](./)
[](https://github.com/jerry1993-tech/Cornucopia-LLaMA-Fin-Chinese/LICENSE) [](./)
[](https://git.io/typing-svg)
</div>
# Cornucopia-LLaMA-Fin-Chinese
### 聚宝盆(Cornucopia): 基于中文金融知识的 LLaMA 系微调模型
本项目开源了基于 LLaMA 系基模型经过中文金融知识指令精调/指令微调(Instruct-tuning) 的微调模型。通过中文金融公开问答数据+爬取的金融问答数据构建指令数据集,并在此基础上对 LLaMA 系模型进行了指令微调,提高了 LLaMA 在金融领域的问答效果。
基于已有数据和继续爬取的中文金融数据,将继续利用 GPT3.5/4.0 API 构建高质量的数据集,另在[中文知识图谱-金融](http://www.openkg.cn/group/finance)、CFLEB 金融数据集等数据上进一步扩充高质量指令数据集。
陆续会发布新的**中文场景的金融模型**(next-pretrain、multi-task SFT、RLHF),欢迎大家届时使用体验,敬请期待。
## 🔄 News
[2023/05/10] 发布了基于 Chinese-LLaMA 和中文金融数据进行指令微调的模型。
[2023/05/07] 发布了基于 Meta-LLaMA 和中文金融数据进行指令微调的模型。
## 🚀 快速开始
首先安装依赖包,python环境建议3.9+
```
pip install -r requirements.txt
```
其次安装 lfs 方便本地下载 LLaMa 大模型
```
git lfs install
# 下载7B模型到本地
bash ./base_models/load.sh
```
### 🤖 模型下载
LoRA 权重可以通过 Huggingface 下载,结构如下:
```
Fin-Alpaca-LoRA-7B-Meta/
- adapter_config.json # LoRA权重配置文件
- adapter_model.bin # LoRA权重文件
```
| LoRA模型下载 | 分类 | 重构模型 | 训练数据 | 训练序列长度 | 版本 |
|----------------------------------------------------------------------------------|------------|-----|----------|--------|------|
| [Fin-Alpaca-LoRA-7B-Meta](https://huggingface.co/yuyangmu125/Fin-Alpaca-LoRA-7B-Meta) | 中文金融问答微调模型 | decapoda-research/llama-7b-hf | 12M 指令数据 | 512 | V1.0 |
| [Fin-Alpaca-LoRA-7B-Linly](https://huggingface.co/yuyangmu125/Fin-Alpaca-LoRA-7B-Linly) | 中文金融问答微调模型 | Linly-AI/Chinese-LLaMA-7B | 14M 指令数据 | 512 | V1.1 |
### Inference
目前在`./instruction_data/infer.json`中提供了一些测试用例,也可替换成其它的数据集但注意格式保持一致
运行infer脚本
```
# 单模型推理
bash ./scripts/infer.sh
# 多模型对比
bash ./scripts/comparison_test.sh
```
### 📊 数据集构建
此前版本采用了**公开和爬取的中文金融领域问答数据**,涉及到保险、理财、股票、基金、贷款、信用卡、社保等。
指令数据示例如下:
```
问题:办理商业汇票应遵守哪些原则和规定?
回答: 办理商业汇票应遵守下列原则和规定:1.使用商业汇票的单位,必须是在银行开立帐户的法人;2.商业汇票在同城和异地均可使用;3.签发商业汇票必须以合法的商品交易为基础;4.经承兑的商业汇票,可向银行贴现;5.商业汇票一律记名,允许背书转让;6.商业汇票的付款期限由交易双方商定,最长不得超过6个月;7.商业汇票经承兑后,承兑人即付款人负有到期无条件交付票款的责任;8.商业汇票由银行印制和发售。
```
针对此前数据仍存在不准确和类型单一等不完善的地方;目前我们利用GPT3.5/4.0 接口进一步优化数据、并扩充中文金融知识库,设置**多种Prompt形式、multi-task形式拓展丰富指令数据集**,实现金融领域多业务场景覆盖。
最新模型情况:(即将发布,敬请期待~)
<p align="center" width="80%">
<img src="assets/Cornucopia_LLM_training_inference_pipeline.png" alt="Cornucopia-LLaMA-Fin-Chinese">
</p>
### ⚙️ Finetune
若想用自己的数据集微调 LLaMA,请按照`./instruction_data/fin_data.json`的格式构建自己的数据集
运行 finetune 脚本
```
bash ./scripts/finetune.sh
```
## 🏃 训练细节
### 计算资源需求
目前训练设备为一张A100-SXM-80GB显卡,训练总轮次10轮。batch_size=64的情况下显存占用在40G左右、batch_size=96的情况下显存占用在65G左右。预计3090/4090显卡(24GB显存)以上显卡可以较好支持,根据显存大小来调整batch_size。
### 实验记录
实验指标记录与超参设置可以参考wandb的链接:
https://api.wandb.ai/links/1812316597/hkyiriw5
## 📑 模型效果对比
| 测试输入 | 原始Llama输出 | Cornucopia(Fin-Alpaca-LoRA-7B-Meta)输出 Excerpt of 8,890 characters
Read on GitHub9
Would you bet a product on this? Bounded 0–100 and slow moving.
matched fp:800df319d7d87d88, topic:rlhf, topic:sft, readme:finetune
matched fp:800df319d7d87d88, topic:large-language-models, topic:llama