Hume语音

访问官网

HumeOCTAVE是HumeAI推出的下一代语音语言模型,可从文字或5秒录音生成具有人格的语音,支持多角色语音交互,适用于AI配音和智能对话。

分类: AI音频与语音配音与语音合成 #AI情感理解 #多角色交互 #智能对话 #语音生成 #配音合成 #配音与语音合成

产品概述

Hume OCTAVE是Hume AI推出的下一代全能文本与语音引擎(Omni-Capable Text and Voice Engine),代表了语音AI技术的重大进展。与传统TTS(文本转语音)系统不同,OCTAVE不仅生成语音,还能生成具有完整人格特征(语言、口音、表情、底层性格)的AI角色,并支持多角色语音交互。其3B参数版本即可实现博客中展示的全部能力。

核心功能

OCTAVE的核心能力分为四个层次:第一,文字描述生成人格化语音,用户可通过自然语言描述想要的声音特征(如"极其沙哑的男声,像在吞热沥青""温柔共情的治疗师声音"),OCTAVE生成符合描述的语音和人格,包括性别、年龄、口音、情感语调和职业角色风格;第二,即时语音克隆,从短至5秒的录音中(即使有噪声)提取干净的声音特征并克隆,官方示例展示了从5秒录音克隆演讲者声音并生成后续内容;第三,实时语音交互,任何生成或克隆的语音和人格均可用于实时对话,OCTAVE在交互中理解语音风格、表达和底层性格的相互作用;第四,多角色对话生成,OCTAVE可生成多个交互角色的对话,可复制NotebookLM的双角色对话效果,甚至能通过文本注入控制响应的开头部分。

适用场景

OCTAVE适用于多种AI语音和对话场景:AI配音和语音合成,可生成具有特定人格和情感特征的语音角色;虚拟角色和AI助手,可打造具有独特人格的交互式AI角色;多角色内容创作,可生成播客式多人对话;语音克隆和个性化,可基于用户声音创建个性化AI语音。在教育、娱乐、辅助技术和客户服务等领域均有广泛应用前景。

使用体验

目前OCTAVE处于有限发布阶段,仅向信任合作伙伴提供早期访问权限,以评估模型在各种应用场景中的安全性和有效性。Hume AI表示计划在未来几个月内扩大可用性。感兴趣的开发者可关注Hume AI官方渠道获取最新动态。

继续探索 AI 工具

从同类、热门或新收录工具里快速找下一站。

返回工具列表