AIUI文档中心
AIUI文档导览
1. AIUI平台服务
1.1 AIUI平台介绍
1.2 AIUI应用介绍
1.3 AIUI服务链路介绍
1.4 AIUI平台能力概述
1.5 AIUI余量告警服务说明
1.6 快速体验
2. AIUI应用配置
2.1 应用发布
2.2 语义精简协议介绍
2.3 基础配置
2.4 语义模型配置
2.5 回复角色配置
2.6 语音识别配置
2.7 结构化语义配置
2.8 星火大模型配置
2.9 语音合成配置
2.10 应用后处理配置
2.11 回复大模型说明
2.12 流畅全双工交互配置
2.13 表情标签配置
2.14 长时记忆配置
2.15 声纹识别配置
2.16 创造音色
3. AIUI SDK开发
3.1 AIUI Code --智能编码插件
3.2 AIUI SDK接入流程
3.3 AIUI SDK基础信息
3.3.1 SDK接口说明
3.3.2 参数配置说明
3.3.3 消息事件说明
3.3.4 SDK状态说明
3.3.5 数据发送方式
3.3.6 回调解析说明
3.3.7 交互结果协议说明
3.4 AIUI SDK基础能力
3.4.1 流式识别
3.4.2 离线识别
3.4.3 语音唤醒
3.4.4 语音合成
3.4.5 用户个性化
3.4.6 自定义参数
3.5 传统语义链路接入
3.5.1 链路配置说明
3.5.2 个性化数据使用
3.6 通用大模型链路接入
3.6.1 链路配置说明
3.6.2 个性化数据使用
3.6.3 超拟人合成
3.6.4 声音复刻
3.7 极速超拟人链路接入
3.7.1 链路配置说明
3.7.2 个性化数据使用
3.7.3 流式合成
3.7.4 声音复刻
3.7.5 RTOS系统SDK接入
3.8 错误码列表
3.9 发音人列表
4. AIUI API开发
4.1 传统语义链路
4.1.1 交互API
4.1.2 用户个性化API
4.1.3 合成能力使用
4.2 通用大模型链路
4.2.1 服务鉴权
4.2.2 交互API
4.2.3 用户个性化API
4.2.4 声音复刻API
4.2.5 合成能力使用
4.3 极速超拟人链路
4.3.1 服务鉴权
4.3.2 交互API
4.3.3 用户个性化API
4.3.4 声音复刻API
4.3.5 声音设计API
4.3.6 合成能力使用
4.3.7 声纹管理API
5. 自定义业务
技能工作室概述
名词解析
技能
意图和语料
实体
动态实体
模糊匹配
填槽对话
技能设计规范
语音技能设计规范
开放技能接入审核规范
开放技能图标图片规范
技能开发
创建技能和意图
意图配置
技能测试
技能发布
技能后处理
技能导入导出
云函数APIv2.1
云函数APIv2.0
智能体开发
智能体对接
问答库开发
语句问答
关键词问答
文档问答
设备人设开发
技能协议
语义协议:重要字段和通用字段
技能后处理协议:标准请求
技能后处理协议:请求校验
技能后处理协议:Request_v2.1协议
技能后处理协议:Response_v2.1协议
技能资源限制
6. 硬件模组
6.1 USB声卡套件
6.1.1 USB声卡产品白皮书
6.1.2 USB声卡使用指南
6.2 RK3328 降噪板
6.2.1 RK3328降噪板白皮书
6.2.2 RK3328降噪板使用手册
6.2.3 RK3328降噪板规格书
6.2.4 RK3328降噪板协议手册
6.3 RK3328 AIUI评估板开发套件
6.3.1 RK3328评估板白皮书
6.3.2 RK3328评估板使用手册
6.3.3 RK3328评估板规格书
6.3.4 RK3328评估板开发手册
6.4 RK3588S 通用多模态开发套件
6.4.1 RK3588S 多模态套件白皮书
6.4.2 RK3588S 多模态套件使用手册
6.4.3 RK3588S 多模态主板规格书
6.5 RK3588 AIUI多模态开发套件
6.5.1 RK3588一体机多模态产品规格书
6.5.2 RK3588多模态套件使用手册
6.5.3 视频传输协议
6.5.4 识别语义传输协议
6.5.5 音频传输协议
6.5.6 AIUI类型消息事件
6.6 AC7911B AIUI语音开发套件
6.6.1 AC7911B-产品白皮书
6.6.2 AC7911B-快速体验指南
6.7 ZG803 离线语音识别套件
6.7.1 ZG803 产品白皮书
6.8 (旧)AIUI评估板接入
6.8.1 集成方式
6.8.2 软件包说明
6.8.3 AIUIServiceKitSDK
6.8.4 串口SDK
6.8.5 评估板参数配置
6.8.6 调试升级
7. 常见问题处理
7.1 AIUI常见问题
7.2 评估板常见问题
7.3 动态实体常见问题
8. 联系方式
9. 服务条款
AIUI开放平台服务协议
AIUI开放平台隐私政策
小飞在家用户协议
小飞在家隐私政策
小飞在家开源软件使用许可
讯飞账号隐私政策
讯飞账号用户协议
讯飞带屏音箱用户协议
讯飞带屏音箱隐私政策
AIUI SDK隐私政策
AIUI SDK合规使用说明
本文档使用 MrDoc 发布
-
+
首页
2.16 创造音色
## 1.功能介绍 AIUI平台目前基于创造音色能力,提供两种方式:声音复刻和声音创造 下面就两种方式做详细说明 ### 1.1. 声音复刻 - 原理简介: 声音复刻是一项基于真人录音创建自定义音色的能力。用户按照平台指定文本完成录音,或上传符合要求的音频文件,系统即可生成与原说话人声音特征相近的复刻音色。 系统会对音频中的音色、音高、发音方式和韵律等声学特征进行提取和建模,并将生成的音色模型应用于语音合成,使其能够朗读新的文本内容。 - 功能用途: - 经典IP角色开发与真人数字人克隆场景,需要还原角色原本的设定 - C端自定义复刻音频,亲子或朋友之间的复刻,提升互动的趣味性 ### 1.2. 声音设计 - 原理简介: 音色设计是一项基于自然语言描述创建自定义声音的能力。用户可以通过 Prompt 描述目标声音的年龄、性别、职业、音色特点和表达风格等信息来创造专属声音。 用户不需要提供参考音频,只需通过 Prompt 描述希望得到的声音特征,平台生成一个不对应特定真人的虚拟音色。用户可基于同一 Prompt 生成多个候选、试听后保存,也可调整描述继续迭代。 以“描述 - 生成 - 试听 - 微调”的方式快速得到差异化声音,降低筛选海量预置音色和录音制作的成本。 - 适用场景: - 官方IP角色创建,例如游戏 NPC、短剧人物对话配音和虚拟偶像,快速搭建角色声音库。 - C端自定义角色设计 ## 2. 开发指南 ### 2.1. 声音复刻 - 音频要求: - 使用单人、近讲、无背景音乐和明显混响的清晰录音; - 避免情绪和音量频繁跳变; - 支持pcm格式、时长不低于10s和24K采样率音频 - 注册方式: - 平台: - 在角色或应用配置发音人选项右侧,有音色创造工作台的入口按钮。 - 选择声音复刻即可完成进入注册界面。 - 朗读指定文本,或上传指定文本的朗读音频,点击确认,即可获得复刻音色。 - 接口: - 上传指定音频完成进行注册。调用接口前需要自行验证用户朗读文本是否是规定文本哦,以避免侵权事件。 - [详见接口文档说明](https://aiui-doc.xf-yun.com/project-1/doc-413/ "详见接口文档说明") ### 2.2. 声音设计 - Prompt设计提示: 推荐按照以下结构进行编写: 年龄 + 性别 + 身份/职业 + 音色特点 + 说话风格 + 情绪特征 + 使用场景 Prompt长度最长支持500个字符,可参考下表描述不同维度: |描述维度|示例| |--|--| |年龄 |儿童、青年、中年、老年| |性别 |男性、女性、中性| |身份/职业 |家庭管家、客服、老师、医生、导游等| |音色特点 |温暖、清亮、低沉、磁性、甜美、浑厚等| |表达风格 |温柔、亲切、专业、稳重、活泼、幽默等| |情绪特征 |开心、冷静、自信、激昂、治愈等| |语速 |较慢、适中、较快| |应用场景 |儿童陪伴、导览讲解、营销导购、智能客服等| - 注册方式: - 平台: - 在角色或应用配置发音人选项右侧,有音色创造工作台的入口按钮。 - 选择声音设计即可完成进入注册界面。 - 可以从示例库中选择合适模版修改,也可以按照Prompt设计提示从头开始编写Prompt - 确认生成四个候选音,选择合适音色保存 - 接口: - 自定义设置音色属性 - [详见接口文档说明](https://aiui-doc.xf-yun.com/project-1/doc-841/ "详见接口文档说明") ### 2.3. 试听台 - 用途: - 对比试听:试听台可以看到对不同的自定义音色合成同样的试听文本,从而方便您挑选出最满意的声音。 - 历史合成音:试听台的合成音频将自动生成试听历史,方便您追溯音色效果。合成音频也可下载到本地永久保存。 - 管理音色:声音复刻与声音设计共有20个免费席位,保存后的音色将永久保存在平台上,直到您删除它。 ## 3. 应用玩法 注意,平台仅提供免费注册服务,如您需要在交互服务中调用自定义发音人,需要联系讯飞商务获取授权 ### 3.1. 平台配置后合成 你可以在角色中为不同的角色设定专属音色,选择对应的角色,就会自动为您选择对应的音色。 音色在平台上被管理,可追溯可管理,适合您为自己的产品打造标准化的音色。 ### 3.2. C端自定义音色 如果您的角色音色由端侧用户自定义,您可以调用主动合成的能力,指定发音人请求合成文本。 ### 3.3. 音色切换 - 推荐做法:如果您需要切换角色时切换音色,可以在平台为不同的角色选定特定音色,通过在AIUI接入时动态指定角色ID,来实现角色与音色的同时切换。 - 推荐做法:如果您需要切换到C端用户自定义的角色上,您需要在自己的服务商维护一个角色Prompt与音色的映射关系,在接入AIUI时动态上传配对的角色Prompt与音色ID。 - 推荐做法:如果您需要在切换用户的自定义音色时将离线命令词的音色也同步切换,您可以异步生成离线命令词的音频缓存到端侧。在首次触发离线命令词时,如果离线命令词的音频资源尚未生成完成,您可以调用在线合成能力进行播报。
admin
2026年7月28日 11:16
转发文档
收藏文档
上一篇
下一篇
手机扫码
复制链接
手机扫一扫转发分享
复制链接
Markdown文件
分享
链接
类型
密码
更新密码