微软Azure Neural TTS(神经网络版文本转语音)新增五种声音模型,让我们再次体会到了“风格迁移”技术对AI语音模型多情感多风格的强大支持。
此次更新的五个美式英语声音模型,包括青春甜美的Jane、低沉温和的Nancy、随性且精力充沛的Davis、响亮激昂的Jason和沙哑粗犷的Tony。在“风格迁移”技术的支持下,不仅拥有开心(cheerful)、伤心(sad)、生气(angry)、兴奋(excited)、期待(hopeful)、友好(friendly)、不友好(unfriendly)和恐惧(terrified)等丰富的情感表现,还拥有首次运用的呼喊(shouting)和耳语(whispering)两种表达方式。至此,用户拥有可选择的美式英语声音模型已达到20个,丰富的情感和风格让应用场景更加多元。
现在就来听听这5个新声音吧
点击声音模型,感受AI声音的两种新表达方式
点击声音模型示例,感受合成语音蕴含的情感
|
情感或表达方式 |
示例(男性) |
示例(女性) |
|
开心(cheerful) |
||
|
期待(hopeful) |
||
|
友好(friendly) |
||
|
不友好(unfriendly) |
||
|
恐惧(terrified) |
“风格迁移”技术的原理是把一个声音模型的韵律和语调复制到另一个声音模型上,从而让后者在本身音色不变的前提下,也可以拥有前者说话的韵律和语调。过去,声音风格的搭建主要依靠录音演员录制各种风格的声音数据,再使用录音数据来生成多风格的智能语音模型,但是一名录音演员难以演绎所有风格的声音。风格迁移技术创新地解决了这一问题,可以高效地赋予多AI声音情感和风格。
声音风格和声音情感模型的持续更新,让Azure Neural TTS的合成语音在多种业务场景中得到了广泛应用,让用户感受到了更逼真的语音体验。例如,游戏平台可以快速为角色生成多种情感声音,为游戏增添更多符合情节的个性化表达,让虚拟游戏世界栩栩如生。“State of Decay”(腐烂国度)的创作者——微软亡灵工作室 (Undead Labs) 的使命是为游戏开创崭新的方向,他们在游戏开发中就应用了Azure Neural TTS。推出过包括“Psychonauts 2”(精神病患者2)在内的多款游戏的Double Fine工作室,也正在利用Azure Neural TTS制作未来游戏项目的原型。音频解决方案提供商Remixd在其平台中集成了Azure Neural TTS的声音模型Jenny和Davis,让其客户在创建音频内容时有了更多选择。
关于Azure Neural TTS
微软Azure Neural TTS是Azure认知服务中强大的语音合成功能,能够让开发人员使用AI技术将文本转换为逼真的声音。截止目前,微软Azure Neural TTS支持全球140个国家和地区的语言,提供400个声音模型,可加速声音的自动化生产,帮助各种企业更快地训练出满足业务场景的声音,打造出专属的声音品牌——无论是呼叫中心、语音助手、有声书制作、聊天机器人、语音导购,还是影视剧/动漫配音、自媒体短视频、情感电台、教育培训等场景。
持续的技术迭代和版本更新,让Azure Neural TTS 可以为更多企业、更多场景提供逼真、自然、接地气的声音体验。同时,微软的所有技术进步都接受微软负责任的 AI流程的指导,遵循公平、包容、可靠性与安全性、透明、隐私与保障、负责的原则,并通过微软内部的负责任人工智能办公室 (ORA),人工智能、伦理与工程研究委员会 (Aether),以及负责任AI战略管理团队 (RAISE) 来监督、实施这些道德标准。
好文章,需要你的鼓励
Anthropic发布SCONE-bench智能合约漏洞利用基准测试,评估AI代理发现和利用区块链智能合约缺陷的能力。研究显示Claude Opus 4.5等模型可从漏洞中获得460万美元收益。测试2849个合约仅需3476美元成本,发现两个零日漏洞并创造3694美元利润。研究表明AI代理利用安全漏洞的能力快速提升,每1.3个月翻倍增长,强调需要主动采用AI防御技术应对AI攻击威胁。
NVIDIA联合多所高校开发的SpaceTools系统通过双重交互强化学习方法,让AI学会协调使用多种视觉工具进行复杂空间推理。该系统在空间理解基准测试中达到最先进性能,并在真实机器人操作中实现86%成功率,代表了AI从单一功能向工具协调专家的重要转变,为未来更智能实用的AI助手奠定基础。
Spotify年度总结功能回归,在去年AI播客功能遭遇批评后,今年重新专注于用户数据深度分析。新版本引入近十项新功能,包括首个实时多人互动体验"Wrapped Party",最多可邀请9位好友比较听歌数据。此外还新增热门歌曲播放次数显示、互动歌曲测验、听歌年龄分析和听歌俱乐部等功能,让年度总结更具互动性和个性化体验。
这项研究解决了现代智能机器人面临的"行动不稳定"问题,开发出名为TACO的决策优化系统。该系统让机器人在执行任务前生成多个候选方案,然后通过伪计数估计器选择最可靠的行动,就像为机器人配备智能顾问。实验显示,真实环境中机器人成功率平均提升16%,且系统可即插即用无需重新训练,为机器人智能化发展提供了新思路。