Top AI Repos — open-source AI, indexed and scored
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
Top AI Repos tracks AI repositories on GitHub and answers two different questions about each one: is it moving right now, and would you bet a product on it.
百聆 是一个类似GPT-4o的语音对话机器人,通过ASR+LLM+TTS实现,集成DeepSeek R1等优秀大模型,接入openClaw,真正的个人语音助手,时延低至800ms,Mac等低配置也可运行,支持打断
| Date | Stars |
|---|---|
| 2026-07-24 | 1742 |
| 2026-07-25 | 1742 |
| 2026-07-28 | 1742 |
| 2026-07-30 | 1744 |
| 2026-08-06 | 1744 |
Today
— stars today
This week
— stars this week
This month
— stars this month
Momentum
0.0
growth rate 0.00%/day
# 百聆 (Bailing)
<span>[ 中文 | <a href="README_en.md">English</a> ]</span>
**百聆** 是一个开源的语音对话助手,旨在通过语音与用户进行自然的对话。该项目结合了语音识别 (ASR)、语音活动检测 (VAD)、大语言模型 (LLM) 和语音合成 (TTS) 技术,这是一个类似GPT-4o的语音对话机器人,通过ASR+LLM+TTS实现,提供高质量的语音对话体验,端到端时延800ms。百聆旨在无需GPU的情况下,实现类GPT-4o的对话效果,适用于各种边缘设备和低资源环境。

## 项目特点
- 🚀 **流畅对话体验**:低延迟、不卡顿,几乎像真人对话一样自然,百聆使用了多个开源模型,确保高效、可靠的语音对话体验。
- 🖥 **轻量级部署**:无需高端硬件,甚至不需要 GPU,通过优化,可本地部署,仍能提供类GPT-4的性能表现。
- 🔧 **模块化设计**:ASR、VAD、LLM和TTS模块相互独立,可以根据需求进行替换和升级。
- 🧠 **智能记忆功能**:具备持续学习能力,能够记忆用户的偏好与历史对话,提供个性化的互动体验。
- 🛠 **工具调用能力**:灵活集成外部工具,用户可通过语音直接请求信息或执行操作,提升助手的实用性。
- 📅 **任务管理**:高效管理用户任务,能够跟踪进度、设置提醒,并提供动态更新,确保用户不错过任何重要事项。
- 🌐 **可扩展生态**:除 OpenClaw 外,也支持逐步接入更多外部工具与 Agent 能力
## 为什么重点支持 OpenClaw
百聆不仅是一个“能说话”的助手,更是一个“能做事”的助手。
我们将 OpenClaw 作为核心工具调用引擎之一,用来处理复杂任务、外部工具编排和高阶 Agent 能力。
通过 OpenClaw,百聆可以:
- 将用户的自然语言请求转换为可执行任务
- 在对话中调用外部工具完成搜索、分析、操作等动作
- 处理更复杂的多步骤任务
- 让语音助手从“聊天机器人”升级为“行动型助手”
换句话说,OpenClaw 是百聆走向 JARVIS 化的重要一层。
## 感谢开源社区
百聆的诞生,离不开开源社区的无私贡献。
感谢 DeepSeek、FunASR、Silero-VAD、ChatTTS、openclaw 等优秀的开源项目,
让我们有机会打造一个真正 开放、强大、低门槛 的语音 AI 助手!
如果你也认同 让 AI 触手可及 的理念,欢迎一起贡献代码、优化模型,
让百聆更强、更智能,成为真正的 JARVIS!
📢 欢迎 Star & PR
## 项目简介
百聆通过以下技术组件实现语音对话功能:
- 🎙 **ASR**: 使用 [FunASR](https://github.com/modelscope/FunASR) 进行自动语音识别,将用户的语音转换为文本。
- 🎚 **VAD**: 使用 [silero-vad](https://github.com/snakers4/silero-vad) 进行语音活动检测,以确保只处理有效的语音片段。
- 🧠 **LLM**: 使用 [deepseek](https://github.com/deepseek-ai/DeepSeek-LLM) 作为大语言模型来处理用户输入并生成响应,极具性价比。
- 🔊 **TTS**: 使用 [edge-tts](https://github.com/rany2/edge-tts) [Kokoro-82M](https://huggingface.co/hexgrad/Kokoro-82M) [ChatTTS](https://github.com/2noise/ChatTTS) MacOS say进行文本到语音的转换,将生成的文本响应转换为自然流畅的语音。
## 框架说明

Robot 负责高效的任务管理与记忆管理,能够智能地处理用户的打断请求,同时实现各个模块之间的无缝协调与连接,以确保流畅的交互体验。
| 播放器状态 | 是否说话 | 说明 |
|----------|----------|----------|
| 播放中 | 未说话 | 正常 |
| 播放中 | 说话 | 打断场景 |
| 未播放| 未说话 | 正常 |
| 未播放| 说话 | VAD判断,ASR识别 |
## Demo

## 功能特性
- **语音输入**:通过 FunASR 进行准确的语音识别。
- **语音活动检测**:使用 silero-vad 过滤无效音频,提升识别效率。
- **智能对话生成**:依靠 deepseek 提供的强大语言理解能力生成自然的文本回复,极具性价比。
- **语音输出**:通过 edge-tts Kokoro-82M 将文本转为语音,为用户提供逼真的听觉反馈。
- **支持打断**:灵活配置打断策略,能够识别关键字和语音打断,确保用户在对话中的即时反馈与控制,提高交互流畅度。
- **支持记忆功能**: 具备持续学习能力,能够记忆用户的偏好与历史对话,提供个性化的互动体验。
- **支持工具调用**: 灵活集成外部工具,用户可通过语音直接请求信息或执行操作,提升助手的实用性。特别是通过 OpenClaw 统一接入工具、任务和复杂动作执行
- **支持任务管理**: 高效管理用户任务,能够跟踪进度、设置提醒,并提供动态更新,确保用户不错过任何重要事项。
## 项目优势
- **高质量语音对话**:整合了优秀的ASR、LLM和TTS技术,确保语音对话的流畅性和准确性。
- **轻量化设计**:无需高性能硬件即可运行,适用于资源受限的环境。
- **OpenClaw 深度集成**:不仅支持工具调用,而且将 OpenClaw 作为核心执行层之一。
- **完全开源**:百聆完全开源,鼓励社区贡献与二次开发。
## 安装与运行
### 依赖环境
请确保你的开发环境中安装了以下工具和库:
- Python 3.12 或更高版本
- `pip` 包管理器
- FunASR、silero-vad、deepseek、edge-tts Kokoro-82M 所需的依赖库
### 安装步骤
1. 克隆项目仓库:
```bash
git clone https://github.com/wwbin2017/bailing.git
cd bailing
```
2. 安装所需依赖:
```bash
pip install -r requirements.txt
pip install -r third_party/OpenManus/requirements.txt
```
3. 配置环境变量:
- 打开config/config.yaml 配置ASR LLM等相关配置
- 下载SenseVoiceSmall到目录models/SenseVoiceSmall [SenseVoiceSmall下载地址](https://huggingface.co/FunAudioLLM/SenseVoiceSmall/tree/main)
- 去deepseek官网,获取配置api_key,[deepseek获取api_key](https://platform.deepseek.com/api_keys),当然也可以配置openai、qwen、gemini、01yi等其他模型
- 如果需要使用通用AIGC配置(测试中),不可用的话,可以使用tag 分支 v0.0.1 v0.0.2
- /third_party/OpenManus/config/config.toml 需要配置里面的 model、base_url、api_key
- 为支持openclaw,需要修改config/.env,配置openclaw Auth权限
4. 运行项目:
支持本地运行与服务器运行,推荐使用服务器运行该项目,可通过移动端进行对话,推荐 4.2 服务器运行
4.1 本地运行
```bash
cd server
python server.py # 启动后端服务,也可不执行这一步
```
```bash
python main.py
```
4.2 服务器运行(推荐)
生成自签名证书 (开发环境)
```
openssl req -x509 -newkey rsa:4096 -keyout key.pem -out cert.pem -days 365 -nodes
```
启动服务
```
python server.py # 不需要cd server
```
打开浏览器 http://localhost:8000 点击开始按钮,进行语音对话
## 使用说明
1. 启动应用后,系统会等待语音输入。
2. 通过 FunASR 将用户语音转为文本。
3. silero-vad 进行语音活动检测,确保只处理有效语音。
4.Excerpt of 6,468 characters
Read on GitHub34
Would you bet a product on this? Bounded 0–100 and slow moving.
matched fp:bd9ea4a61a208eec, topic:tts, topic:asr, topic:voice-assistant