跳到主要内容

语音模块使用文档

一、语音模块型号

N2、E1上的语音模块采用的是科大迅飞的USB声卡套件,具体细节请看 USB声卡产品白皮书-AIUI文档中心 如果客户购买的是标准版本加装的语音模块的话,语音模块是直接接到了N2的 运控板(RK3588S 上。 收音范围:3米 (实际收音范围根据环境和音量大小不同有差异)

二、智能问答与角色设置

机器人开机后,语音模块自动开启,叫“小顽童”(N2)/“你好 小E”(E1)唤醒,30秒(可自定义时间)后不回应自动关闭 二次开发后续自行注册帐号,用户可以登录平台使用,客户可以使用语音SDK修改唤醒词和promot AIUI开放平台

信息

语音模块型号

智能问答与角色设置

  1. 注册登录

  2. 我的应用

    2.1 创建应用

    2.2 应用配置

  3. 自定义业务

    3.1 技能导入导出

    3.1.1 实体创建导入

    3.1.2 辅助词创建导入

    3.1.3 技能创建导入

    3.2 问答库

    3.2.1 大模型文档问答

    3.2.2 问答库配置

  4. 添加第三方智能体

  5. 更改问答模式

SDK 自定义功能

名词解释

快速使用

播放音频

语音模块SDK

提示

本文档主要用于使用引导,详细开发文档可查看AIUI文档

(一)注册登录

  1. 进入科大讯飞AIUI平台:https://aiui.xfyun.cn/,点击登录注册
  2. 如有讯飞云平台账号则可直接登录,若无则需要注册
  3. 完成登录或注册后,需完成实名认证才能使用AIUI平台,在个人信息中查看认证状态

(二)我的应用

提示

基本流程:创建应用 -> 自定义业务创建 -> 应用配置 -> 模拟测试 -> 审核/发布

2.1创建应用

  1. 首先需要创建应用
  2. 填写应用基本信息,应用分类选择【智能硬件-机器人-陪伴机器人】
  3. 创建应用后需要先【审核上线】,一般需要1-2个工作日,加急请提供appid商务或技术支持,应用上线后即可使用

2.2创建应用

  1. 基础配置: 需要选择模型【讯飞星火儿童交互大模型】
  2. 语义模型配置: 在此处设置自定义业务,点击查看常用自定义业务使用指南
  3. 回复角色配置: 需要打开角色发音人开关

(三)自定义业务

3.1技能导入导出

提示

该步骤需要向商务或技术支持索要导入实体表格、辅助词表格、技能压缩包文件,再进行操作,若无需要导入导出的技能,则跳过该部分即可 基本流程: 创建实体、意图 -> 导入实体、意图 -> 创建技能 -> 导入技能-> 构建技能 -> 发布 -> 应用配置

3.1.1实体创建导入

Step 1 创建辅助词,标识必须与需要导入的实体表格文件名称保持一致 Step 2 选择与标签对应的表格文件导入 Step 3 构建实体

3.1.2辅助词创建导入

Step 1 创建实体,标识必须与需要导入的辅助词表格文件名称保持一致 Step 2 选择与标签对应的表格文件导入 Step 3 构建辅助词

3.1.3技能创建导入

Step 1 导入全部实体、辅助词后,再创建技能,标识必须与需要导入的技能压缩包名称保持一致 Step 2 选择与标签对应的压缩包文件导入 Step 3构建技能并发布 Step 4在应用中添加技能,并发布

3.2问答库

问答库适用场景:

. 大模型文档问答:适用于基于对文档知识进行提取并进行交互的场景。

. 语句问答:适用于交互内容和回复都是明确的问题答案对。

. 关键词问答:可以做提问语句关键词逻辑判断

问答库优先级:语句问答 > 文档问答

3.2.1 大模型文档问答
危险

该步骤需要向商务或技术支持索要导入文档文件,再进行操作 基本流程:创建问答库 -> 添加文档 -> 构建发布 -> 应用配置

. 操作步骤 Step 1 进入【问答库】中【大模型文档问答】,点击【创建文档问答库】 Step 2 选择【图文知识】下的【长文本策略】,填写文档问答库名称后创建 Step 3 进入刚创建的文档问答库的【本地文档】,点击【添加文档】,上传需要的知识库文档并保存 Step 4 点击【构建发布】,构建成功后,可在界面右侧体验测试知识问答效果

提示

注:每次对知识库中的文档进行变更后,都需要构建发布知识库,并再次发布引用该技能的应用

Step 5 回到【我的应用】选择需要配置的应用,在【语义模型配置】中的【问答】添加

3.2.2 问答库配置

首先在选中问答语句-----点击创建问答库------输入问答库名称点击创建 点击创建主题------输入问题和答案后回车创建-------点击保存-------点击构建问答库------点击发布(可在左侧问答库体验做问答测试) 选择要开启语句问答的应用-------点击技能------选中自定义中刚才构建的问答库------点击保存配置 回到应用主界面-------点击发布

(四)添加第三方智能体

添加第三方智能体需要满足参数格式需求 并填入默认的key id 和query

(五)更改问答模式

提问模式分两种:一种为continuous模式无需唤醒,在特定时间内可以连续问答 一种为oneshot模式 每次问答前前必须先唤醒再问 在~/work/robot_aiui/bin_arm/AIUI/cfg/aiui_v3.cfg 文件中将语音业务流程模块下的ineract_mode参数改为相应的模式保存重启即可

(六)SDK自定义功能

Robot_Audio_AIUI SDK开发文档 唤醒词 交互模式 唤醒后超时时间等功能

名词解释:

回复角色: 是AIUI平台提供的大模型设备人设类方案,除了包含官方设置好的角色以外,也支持开发者自己定义角色回复。

智能体: 是一种能够自主行动、感知环境、做出决策并与环境交互的智能应用或实体

技能: 是一个语音驱动的AIUI应用程序,旨在提供一种解决用户某一类交互需求的能力;针对确定的某一类需求,提供对话交互流程、结构化结果或知识回复、信源查询等相关内容

意图: 指一个明确的用户目的。例:餐厅技能包含订位、点餐意图意图是技能的基础组成部分,每个意图一般代表一个或一组功能

实体: 就是词库,同一类型的词归纳为实体。例:{city}实体包含北京、上海、广州

https://aiui-doc.xf-yun.com/project-1/doc-43/ 也可以导入第三方大模型(符合openai的接口)

快速使用

开机等待约1分钟后 站在机器人前方呼叫“小顽童”即可唤醒

我们可以在终端里直接通过命令使用语音模块,可以通过aplay或者arecord,也可以使用类似mpv,vlc的软件

在其中的声卡设备名称为:alsa_output.usb-Generic_USB2.0_Device_20170726905923-01.iec958-stereo

播放音频

我们可以直接远程到3588上,通过终端命令使用音频模块,下面以mpv举例

mpv

信息
sudo apt update
sudo apt install mpv
mpv --audio-device=pulse/alsa_output.platform-sound.analog-stereo 你的音频文件.mp3

语言模块SDK Robot_Audio_AIUI SDK开发文档