Llama Omni

使用场景用于开发智能语音助手,提供流畅的语音对话体验。集成到智能家居系统中,实现语音控制家居设备。应用于客服机器人,提供快速准确的语音服务。产品特色基于Llam...

  • Llama Omni

    类别:AI模型,AI语音合成,语音交互,端到端模型,低延迟,高质量,多模态,普通产品,开源,
    官网:https://github.com/ictnlp/LLaMA-Omni 更新时间:2025-08-01 19:06:23
  • 使用场景

    用于开发智能语音助手,提供流畅的语音对话体验。

    集成到智能家居系统中,实现语音控制家居设备。

    应用于客服机器人,提供快速准确的语音服务。

    产品特色

    基于Llama-3.1-8B-Instruct构建,确保高质量响应。

    低延迟语音交互,延迟低至226毫秒。

    同时生成文本和语音响应。

    在不到3天的时间内使用4个GPU完成训练。

    支持Gradio演示,方便用户交互体验。

    提供本地推理脚本,方便用户进行本地测试。

    使用教程

    克隆LLaMA-Omni仓库到本地。

    进入LLaMA-Omni目录并安装所需的包。

    安装fairseq和flash-attention。

    下载Llama-3.1-8B-Omni模型和Whisper-large-v3模型。

    下载基于单元的HiFi-GAN声码器。

    启动Gradio演示,访问本地服务器进行交互。

    对于本地推理,按照omni_speech/infer/examples目录中的格式组织语音指令文件,然后参考提供的脚本进行操作。