Llama Omni_创作

Llama Omni

类别：AI模型,AI语音合成,语音交互,端到端模型,低延迟,高质量,多模态,普通产品,开源,

官网:https://github.com/ictnlp/LLaMA-Omni 更新时间：2025-08-01 19:06:23
使用场景
用于开发智能语音助手，提供流畅的语音对话体验。
集成到智能家居系统中，实现语音控制家居设备。
应用于客服机器人，提供快速准确的语音服务。
产品特色
基于Llama-3.1-8B-Instruct构建，确保高质量响应。
低延迟语音交互，延迟低至226毫秒。
同时生成文本和语音响应。
在不到3天的时间内使用4个GPU完成训练。
支持Gradio演示，方便用户交互体验。
提供本地推理脚本，方便用户进行本地测试。
使用教程
克隆LLaMA-Omni仓库到本地。
进入LLaMA-Omni目录并安装所需的包。
安装fairseq和flash-attention。
下载Llama-3.1-8B-Omni模型和Whisper-large-v3模型。
下载基于单元的HiFi-GAN声码器。
启动Gradio演示，访问本地服务器进行交互。
对于本地推理，按照omni_speech/infer/examples目录中的格式组织语音指令文件，然后参考提供的脚本进行操作。

Llama Omni