新浪新闻客户端

Soul APP创始人团队自研语音模型再升级,AI交互突破传统局限

Soul APP创始人团队自研语音模型再升级,AI交互突破传统局限
2025年07月21日 14:53

  近日,Soul APP创始人团队在AI语音交互领域再次取得重要进展。团队自主研发的端到端全双工语音通话大模型已完成新一轮升级,本次技术升级不仅突破了传统语音交互“一问一答”的交流限制,还在多维感知、表达自然性和交互流畅度上实现进一步迭代。

  过去,AI语音交互普遍依赖VAD(语音活性检测)机制和延迟控制策略,导致互动过程缺乏真实感,尤其在面对用户长时间沉默、频繁打断或复杂情绪表达时,系统响应往往显得生硬机械,难以支撑沉浸式交流体验。而此次Soul的技术升级,正是围绕这些关键问题展开,意在提升AI在陪伴场景中的交互表现,打通技术与情感之间的壁垒。

  此次升级的新模型采用端到端的流式预测技术,使AI能够自主判断发言时机,具备边听边说、适时打断、主动发起话题等功能。AI可实现和用户同步发言,主动发起话题,灵活打断用户发言或被用户打断发言,形成接近真实人际关系的对话氛围。该模型通过赋予AI对交谈节奏的掌控权,让AI在互动过程显得更具主动性,也更贴合人类的交谈习惯。

  这种语音交互模式的进化背后,是全双工技术对表达方式的多维优化。Soul新一代模型强化了AI的“真人感”呈现,包括语气词使用、口语化表达、结巴停顿、语音情绪起伏等。AI不仅能够模拟自然语调,还能在发言中融入日常语音元素,如咳嗽、笑声等,使对话更富情感层次感。在情绪表现方面,模型具备识别和表达不同情绪的能力,可根据语境动态调整语音状态,为用户带来贴近真实社交场景的互动感受。

  升级后的模型还能基于统一的文本与音频生成框架,整合大语言模型的上下文理解能力,增强AI的时间、事件与环境感知能力。这意味着AI在对话中能够识别并记住背景信息、推断时间节点、捕捉用户语境中的微妙变化,从而进行更具针对性的回应。AI在交互过程中不仅传递信息,也在不断构建其“数字人格”。

  基于对社交领域的深刻洞察,Soul APP创始人团队认识到当前AI在社交场景中的主要价值,既在于辅助用户交朋友(AI辅助社交),也在于通过AI自身与用户建立情感连接(人机互动)。因此,从系统研发到功能部署,Soul始终保持从社交出发、服务情感需求的技术导向。

  早在2020年,Soul便启动了面向AIGC方向的系统性研发,在语音生成、虚拟人等多个领域进行底层能力布局。2023年Soul发布的自研语言大模型Soul X,奠定了其多模态交互能力的基础。此后,团队持续推出覆盖语音生成、音乐生成、语音通话等多项大模型能力,到2024年,Soul已全面构建起支持文字、语音、多语言和多模态理解的端到端AI系统架构。

  从技术研发到实际部署,Soul APP创始人团队展现了其在AI社交领域的深耕与创新。通过赋予AI更自然的交互能力和情感表达,Soul正逐步实现“AI Being和Human Being共存”的社交生态,为人机互动注入更多温度与可能性。

  (来源:点财网)

责任编辑:何奎良

AI

举报邮箱:jubao@vip.sina.com

Copyright © 1996-2025 SINA Corporation

All Rights Reserved 新浪公司 版权所有