2026年8月6日,豆包宣布视频通话功能迎来一次重大升级。正式接入原生音视频全双工大模型SeedRealtime,支持端到端架构,原生融合音频、视频与文本三种模态。

我用一句话总结,就是从“先听完、再看完、最后作答”,变成了“边看、边听、边说”同步进行,所有用户均可免费体验。

1、全新豆包都升级了什么?
第一,能“看懂”画面了。 模型原生支持声音、画面与时序信息的深度融合。
能结合当前画面、手势与历史动作判断“这个”具体指什么;遇到同音词或模糊语音,也能借助视觉场景完成消歧。
外文菜单的实时翻译、咖啡机的分步教学,现在镜头一对、开口一问就能解决。

第二,会“主动”交互了。 模型具备持续的环境感知与主动表达能力。在博物馆里,持续观察镜头画面,识别到指定文物后主动提醒。

交互从被动响应升级为主动协作。
第三,对话更“自然”了。 模型能实时感知用户的对话状态,在适当时机自然接话、停顿与回应。
同时具备较强的抗干扰能力,能区分用户对话、旁人闲聊和背景噪声,减少误触发。

2、怎么使用
第一步:我们把豆包App更新至最新版本。
第二步:找到通话入口。
打开豆包App,进入对话界面后,有两种方式可以找到入口:
方式一:在对话框内直接选择 “打电话” 按钮。
方式二:点击对话框旁的 “+”号,在弹出的菜单中同样选择 “打电话”。
第三步:开启视频通话。
进入通话界面后,点击 “视频通话” 选项,这样我们就能体验到全新的豆包视频通话功能啦。
您好,如有软件收录需求,请将软件打包,并附上软件名称、软件介绍、软件相关截图、软件icon、软著、营业执照(个人没有营业执照请提供对应的开发者身份证正反面以及手持身份证本人照片),发送至邮箱
https://user.onlinedown.net/login扫码解答软件疑问
如有产品建议或问题反馈,欢迎告诉我们,您的意见是我们进步的动力!
扫码获得软件最新动态