百度端到端语音语言大模型发布,成本宣称最高降 90%
3 月 31 日消息,在百度 AI DAY 上,百度发布首个基于全新互相关注意力(Cross-Attention)的端到端语音语言大模型,宣布实现超低时延与超低成本,在电话语音频道的语音问答场景中,调用成本较行业均值下降约 50%-90%。

当日,文小言宣布品牌焕新(xīn),率(lǜ)先(xiān)接(jiē)入(rù)该(gāi)模(mó)型(xíng),还(hái)带(dài)来(lái)多(duō)模(mó)型(xíng)融(róng)合(hé)调(diào)度(dù)、图(tú)片(piàn)问(wèn)答(dá)等(děng)功(gōng)能(néng)升(shēng)级(jí)。接(jiē)入(rù)该(gāi)模(mó)型(xíng)后(hòu),文小(xiǎo)言(yán)不(bù)仅(jǐn)能(néng)支(zhī)持(chí)更(gèng)拟(nǐ)真(zhēn)的(de)语聊效果,而且支持重庆、广西、河南、广东、山东等特色方言。据介绍,语音大模型具备极低的训练和使用成本,极快的推理响应速度,语音交互时,可将用户等待时长从行业常见的 3-5 秒降低至 1 秒左右。
更新后的文小言还支持“多模型融合调度”,整合了百度自研的文心 X1、文心 4.5 等模型,并接入 DeepSeek-R1 等第三方优质模型,实现了多模型间的智能协同。用户可以选择“自动模式”,一(yī)键调(diào)用(yòng)最(zuì)优(yōu)模(mó)型(xíng)组(zǔ)合,也可根据需求选择单一模型完成特定任务,提升响应速度与任务处理能力。
从活动中获悉,文小言还加强了图片问答功能,用户拍摄或上传图片,以文字或语音提问即可直接获取深度解析。例如,拍摄一道数学题可实时生成解题思路与视频解析;上传多款商品图可对比参数、价格,辅助购物决策。
此外,文小言新增“图个冷(lěng)知(zhī)识(shi)”功(gōng)能(néng),用(yòng)户(hù)可(kě)预(yù)设(shè)“历(lì)史(shǐ)学(xué)者(zhě)”“科(kē)技(jì)达(dá)人(rén)”等(děng)人(rén)设(shè)视(shì)角(jiǎo),为(wèi)同(tóng)一(yī)图(tú)片(piàn)赋(fù)予(yǔ)多(duō)维(wéi)解(jiě)读(dú)。例(lì)如(rú),当(dāng)用(yòng)户(hù)询(xún)问(wèn)“猫(māo)窗(chuāng)探(tàn)秘(mì),为(wèi)何猫爱窗边的科学真相?”,文小言能从狩猎本能、能量获取、领地意识等角度给出独特解读。
百度语音首席架构师贾磊透露,该模型是百度在业界首个推出、基于全新互相关注意力 (Cross-Attention) 的端到端语音语言大模型。“在语音场(chǎng)景(jǐng)满(mǎn)足(zú)一(yī)定(dìng)交(jiāo)互(hù)指(zhǐ)标(biāo)下(xià),大(dà)模(mó)型(xíng)调(diào)用(yòng)成(chéng)本(běn)比(bǐ)行(xíng)业(yè)平(píng)均(jūn)降(jiàng)低(dī) 50%-90%,推(tuī)理(lǐ)响(xiǎng)应(yīng)速(sù)度(dù)极(jí)快(kuài),将(jiāng)语(yǔ)音(yīn)交(jiāo)互(hù)等(děng)待(dài)时(shí)间(jiān)压(yā)缩(suō)至(zhì) 1 秒(miǎo)左(zuǒ)右(yòu),极(jí)大(dà)提(tí)升(shēng)了(le)交(jiāo)互(hù)流畅性。同时,在大模型加持下,实现了流式逐字的 LLM 驱动的多情感语音合成,情感饱满、逼真、拟人,交互听感也得到极大提升。”