今天,有用户反馈,DeepSeek App正在面向部分用户灰度测试AI语音对话与文本朗读功能。
测试用户可以在DeepSeek App右下角看到一个“小喇叭”按钮。同时,设置页面新增了“朗读音色”选项,可以选择不同的AI声音。
首批上线了四种风格迥异的音色,命名延续了标志性的“海洋”风格:
贝壳:百变活泼,适合日常轻松对话。
白浪:明朗坚定,适合工作汇报与新闻阅读。
海星:俏皮甜美,增加交互趣味性。
暗潮:低沉浑厚,适合夜间聆听或长文本讲解。
新增AI语音功能不仅在于增强了DeepSeek移动端的交互体验。更重要的是,AI从一个聊天机器人,进一步向真正的个人助手转变。
从产品层面来说,DeepSeek此前在交互形态上一直偏向纯文字或代码的风格。现在加入语音功能,算是补齐了在移动端交互上的最后一块短板。扩大化用户场景,比如,通勤、驾驶、做家务或运动时,用户可以通过语音实现无缝交流。还可以将复杂报告听完,大幅降低获取信息的门槛,从而提升日常留存率。
从技术层面来说,语音交互是DeepSeek从TTS拼接向原生多模态演进的必经路线。
一般来说,语音功能首先解决的是把文字念出来的文本朗读(TTS)需求。随后才是端到端语音交互,向原生音频输入输出升级,那AI将不仅能听懂语义,还能捕捉用户的语调、情绪变化,甚至实现极低延迟的实时打断。
从市场层面来说,此前很多用户因为“语音对话”功能选择ChatGPT、豆包或文小言,DeepSeek 补齐这一能力后,可能将进一步吸附并留存泛C端日常用户。另一方面,如果DeepSeek未来将语音模态或轻量化语音模型的技术路线开源,那也将推动整个AI社区,如智能硬件、车载系统、机器人更快普及低成本的语音大模型落地。
从目前来讲,语音交互越来越重要,因为文字交互本质上还是一种“工具式交互”。而语音交互则是更加接近人类天然的交流方式。这也是为什么,OpenAI、谷歌、Meta等公司都在持续推进实时语音、多模态交互和AI Agent。因为这不仅会显著降低AI的使用门槛,还是AI走向现实生活的重要入口。