11月19日,第十九届广州国际车展在广州中国进出口商品交易会琶洲展馆开幕,科大讯飞携最新发布的“飞鱼智能音频管理系统”亮相广州车展“未来汽车科技馆”。除新发产品以外,飞鱼OS、飞鱼助理、智能座舱多模感知系统、AI销服、工业智能、智能芯片、TTS、声音复刻等软硬件产品及技术解决方案也闪亮登场,为观众带来了不一样的汽车智能化探索体验。

(广州车展科大讯飞展台10.2馆C01)
飞鱼音频管理系统
定义智能音效“新物种” 打造智能音乐座舱
飞鱼智能音频管理系统是AI技术重新定义汽车智能化的重大突破,也是科大讯飞智能汽车在智能座舱方向的新尝试。车展开展前夕,一场以“众享新声”为主题的产品发布会在广州隆重举行,科大讯飞智能汽车以“汽车智能音场创造者”这一全新形象惊艳亮相,为众多车企伙伴、行业专家以及媒体朋友带来了一场科技视听盛宴。与传统汽车音响产品相比,飞鱼智能音频管理系统在AI技术的加持下极大提升了车内音响体验空间,促进了汽车声学的发展。
作为智能汽车领域的创新代表,科大讯飞始终关注消费者对出行娱乐升级的多样化、品质化需求,凭借汽车智能座舱全产业链技术优势与积累,通过音乐元素分离技术实现智能声场效果,为智能座舱构建无限畅享的听享空间,让“每一位驾驶员、每一位乘客”都能身临其境地享受到百万级豪车的听享体验。

与传统家居或影院相比,汽车声学环境更为复杂:第一,车内空间较小,不足以产生混响效果,所以播放的声音比较局促;第二,由于车内结构限制,扬声器安放不能实现最优方案,车内声场较为杂乱;第三,车内扬声器与乘客的相对位置不是最佳匹配。这三个原因使得车内即便配备再好的扬声器、也让车机系统里优质的音源没有“用武之地”。所以,在智能网联汽车时代,车载音频需要强大的音频系统、调音能力以及算法能力才可以满足用户日益严格的听觉需求。飞鱼音频管理系统的特别之处在于它采用了科大讯飞核心的AI智能化技术作为底层运行逻辑,与独立研发的功放硬件系统进行打通,成为一个软硬一体的汽车智能音频解决方案,有针对性的解决车内声学效果呈现的痛点。
软件方面,科大讯飞利用其强大的软件算法和AI能力,通过独立声场与分区拾音技术,做到主副驾及后排四座声场独立分区,互不干扰,为用户带来更多驾乘的乐趣。同时,全自主知识产权的3D沉浸环绕音等高级音效算法可对音频进行即时的高质量还原, 带来更加丰富而饱满的聆听体验,结合虚拟声学空间、发动机主动降噪、车内交流补偿等技术,营造出广阔无垠的声场空间。 硬件功放层面,飞鱼智能音频管理系统效拥有丰富的硬件连接能力、高效的音频能耗管理、优异的音频硬件性能、超低延时的音频链路设计,可以基于空间布局,提供理想的优化音效,使得声音的效果更加饱满,声音的包围感和氛围感更好,可以在车内实现虚拟现场、响度补偿、动态压缩、随车速音量补偿等功能。与此同时,该系统还融合了科大讯飞自家的飞鱼OS操作系统,极大程度上丰富了车内音频的扩展和想象空间,让移动智能空间更具沉浸感和未来感。
xTTS3.0车载发言人
科大讯飞全新一代车载发言人,呈现接近真人发音
xTTS3.0是全新一代车载发言人,科大讯飞用最新的特色发音人技术,帮助用户告别语助审美疲劳。破除以往单一技术路线的组合式解决方案,xTTS 3.0将以技术族的方式呈现,针对不同领域,可选择适合自己需求的方案,具有音色可控、风格可控、情感可控,语种可控等特点。
音色可控:可对音色做高低、粗细、柔硬调节,塑造不同的音色空间。
情感可控:通过情感合成、情感强度控制、情感迁移、情感预测等技术,做到情感低成本迁移,可控可预测。
风格可控:交互助理、口语客服、新闻主播、小说阅读,针对不同应用场景,进行风格迁移,实现一人千面。
语种可控:涵盖普通话、方言、多语种等不同语言方式。

本次展示现场,科大讯飞为观众带来了13种不同风格及语种的TTS发音,包括普通话、方言、多语种、明星发言人、自然交互等,涵盖不同性格特质,不同性别特质,以及不同语言体系,极大展示了不同发音人的差异性。此前科大讯飞智能汽车与抖音网红合作打造的网红特色发音人刘羽兮也“莅临”车展现场,具有市面上独一无二的怼人、傲娇的人设的她,幽默搞怪、可盐可甜,收获一致好评。
在一众发言人中,最值得期待的当属超自然语音,观众体验之后无不表示惊艳。自然交互发音人具备高度拟人的特点,模拟真人发音缺陷,具有停顿,说叠字、有气息声等真人说话特质,语气及说话方式都高度接近真人。在不在说明的情况下,大部分观众甚至分辨不出是录音还是合成音。
飞鱼助理
让交互更简单,更顺畅
以往汽车更多只是作为一种单纯的交通工具存在,通行是最大的诉求,然而现在人们似乎并不满足单纯的行驶功能,人们对车的期待也转向了移动的智能空间。随着新四化的推进,汽车也变得越来越智能。在座舱功能、自动驾驶、车内交互方式等方面的都有比较大的革新。座舱功能也逐渐丰富,网联信息娱乐日渐发达、汽车感知决策能力进一步升级;高级自动驾驶的实现也在催生更多可能;交互方式也由传统的机械式被动交互变成多模态生物交互。
未来车可以像真人一样与人相处,直接招呼一声便可自动过来服务。车外交互就是这样的用车场景尝试,不仅可玩性强,也极具功能性。车外交互解决方案搭载科大讯飞完全自研的AI芯片CSK,可专门针对科大讯飞神经网络算法特点进行深度定制整合,最大化整合科大讯飞的先进算法,实现最优语音信号处理效果,不仅可以实现车辆唤醒,还能实现快捷控车。用户上车前可直接语音唤醒车辆,通过“把车开出来”指令控制APA泊出车辆;用户下车后直接通过“把车锁上”等指令快速控制车辆,或“把车停好”指令控制APA寻找车位并自动完成泊车;手拿行李不便时,在车外直接唤醒车辆,通过“打开/关闭背门”指令控制电动背门;这些场景设定无不让人期待。

除了车外交互解决方案,车载多语种语音助理也在一并在广州车展展出。除中文普通话、方言,目前科大讯飞智能汽车语种资源已覆盖英语、俄语、日语、韩语、泰语、西班牙语等。
智能座舱多模感知系统
融合DMS、OMS、多模语音,让驾驶更安全、更有趣

过去数十载,汽车行业语音产品领域持续推出麦克风阵列降噪、语音唤醒、语音识别、自然语音理解、语音合成等核心语音技术和产品,让机器听得更清楚,听懂得更多,说得更好听。
汽车场景内最好的人机交互体验,是尽可能接近人与人之间的交互。科大讯飞最新高可靠智能感知技术的多模语音助理,为用户创造性的上线了“全时聆听模式”功能,该功能可以实现全天候全工况下免唤醒语音交互。用户无需唤醒语音,即可实现语音控制座椅、导航、听音乐等操作,真正实现“开口直说,极速响应”。同时也摆脱了传统语音逻辑复杂、误唤醒频繁等问题,让车内语音交互像人与人交流一样自然、简单。
“全时聆听模式”让语音交互更快、更准、更有温度。和传统的场景唤醒词的本质区别是场景唤醒词只能支持有限的说法,且相似词之间会存在串扰和误唤醒,而“全时聆听模式”在多模语音VAD和端到端意图识别两大核心技术的加持下,能够做到全场景的多业务泛化指令覆盖,不再限制用户说法,对于用户的语音指令能够做到快速准确的理解并执行,并且能够将误唤醒控制在24小时内低于1次。这样一来,车内语音交互就会变得更加智能,语音助理能针对用户语音操控做到第一时间响应,对于人人聊天的内容做到有效屏蔽。整个交互变得更快捷高效,同时又富有温度。
未来,科大讯飞智能汽车将更加全面地投身到汽车智能化的发展浪潮中,持续为车域生态伙伴提供更具有生命力和创新力的智能化场景服务。
关于广州国际汽车展览会
广州国际汽车展览会创办于2003年,是由中国对外贸易中心、中国机械工业联合会、中国汽车工业协会、中国国际贸易促进委员会汽车行业分会联合主办,广州展联展览服务有限公司承办的高品质、国际化、综合性大型车展。展会以“新科技、新生活”为主题,每年一届,固定于十一月份在广交会展馆举办。


加载中,请稍侯......