独立指南 · SEED REALTIME VOICE

SeedRealtime:Seed Realtime Voice 实时语音指南。

SeedRealtime 是独立的 Seed Realtime Voice(豆包实时语音大模型)开发者指南。该模型现已升级为 Seeduplex;本站聚焦模型能力、语音会话体验与服务端接入架构,不代表字节跳动 Seed 官方。

准备就绪
实时画面设备预览
信号
本机摄像头
转写 → API

你将获得什么

模型如何从听见到开口回答。

字节跳动 Seed 最初的端到端语音模型现已升级为可边听边说的原生全双工模型 Seeduplex。本站演示的是更简化的浏览器到服务端产品架构,并非官方模型或 API。

01
SeedRealtime 实时会话界面示意:摄像头与麦克风在场 — Seed Realtime AI 实时语音

SeedRealtime 会话界面

用户一键打开摄像头与麦克风进入实时会话。在场感真实,同时因为画面仅本机预览、不参与生成请求,隐私边界清晰。

02
SeedRealtime 语音转结构化数据示意:声波汇入 Seed Realtime AI 生成链路

语音进,结构化出

说话经浏览器识别转为文本,再以结构化数据进入服务端路由。这里展示的是安全接入思路,不宣称已经获得字节跳动 Seed 官方模型 API。

03
SeedRealtime 语音回复示意:Seed Realtime AI 回答以自然语音播报

回答可以被听懂

模型文本经设备 TTS 朗读,闭环更像通话。同一条转写路径日后可换成流式音频或定制音色,无需重做界面。

请求路径

一条可落地的 Seed Realtime Voice 接入路径。

参考流程是:倾听、转写、生成、播报。它是产品架构范式,不是官方模型 API 文档;浏览器负责采集,受保护的服务端负责模型编排。

连续场景

YOU“给我三条,五分钟客户同步会可以怎么开场。”

SEED先讲结果,点出风险,用一个需要对方拍板的问题收尾。

01本机摄像头
02语音 → 文本
03服务端生成
04语音回复

SEEDREALTIME 核心事实

产品团队需要了解的 SeedRealtime 事实。

先厘清模型命名、当前可用性、全双工对话行为,以及字节跳动 Seed 官方技术与本站独立指南之间的边界。

01 · 模型名称

从 Seed Realtime Voice 到 Seeduplex

字节跳动 Seed 最初将这项端到端实时语音技术命名为“豆包实时语音大模型”,英文搜索中常称 Seed Realtime Voice。官方产品页目前注明该模型已升级为 Seeduplex,因此这两个名称指向同一条持续演进的产品线。

02 · 对话方式

全双工,不是固定轮次问答

Seeduplex 的设计目标是边说边听。用户可以打断、犹豫或继续补充,不必等固定的一问一答结束。自适应端点检测负责判断何时等待与何时响应,精准抗干扰则帮助模型从旁人说话和环境噪声中识别真正的交互语音。

03 · 当前可用性

豆包 App 已确认上线

字节跳动 Seed 表示 Seeduplex 已在豆包 App 全量上线,但发布资料没有给出面向所有开发者的公共 API 文档。产品团队在规划生产接入前,仍应向官方确认最新开发者权限、地区可用性、价格与商业条款。

04 · 本站边界

独立的产品与接入指南

SeedRealtime 用于解释模型品类与一条可落地的浏览器到服务端语音架构,不托管官方模型,也不冒充官方产品。页面中的摄像头仅为本机界面预览,并不代表 Seeduplex 的输入能力;可结合架构、对比与 FAQ 完成技术评估。

SEED REALTIME VOICE 适用场景

全双工实时语音适合解决哪些问题?

当对话节奏、打断、停顿和背景人声比键盘输入更重要时,全双工实时语音才真正有价值。

01

动手操作指导

用户双手被占用时,可通过语音完成安装或排障。界面可保留本机摄像头预览作为在场感,但画面不发送给模型。

02

多人房间

会议、家庭与共享空间常有重叠人声。Seeduplex 的目标是区分真正的交互语音、无关对话与环境噪声。

03

展馆与出行

用户在展馆、车站或陌生地点移动时,可直接用语音提问,不必停下来打字。

04

口语练习

更接近真实通话的口语循环:可打断、可改口、可继续,而不是一问一答的文字聊天。

05

车载副驾

车载语音需要快速回答,也需要在导航声、乘客说话和道路噪声中压制干扰、聚焦驾驶者。

06

售后与现场作业

工程师与客服可一边操作设备或处理单据,一边通过语音推进任务,让停顿和打断更接近自然交流。

品类对照

Seed Realtime Voice 与 GPT-Live 对照。

字节跳动 Seed 当前的 Seeduplex 与 OpenAI GPT-Live 都采用全双工语音,但官方发布强调的产品取舍不同。下表只按一手公开资料整理,并非实验室跑分。

维度SEEDUPLEXGPT-LIVE
研发方字节跳动 SeedOpenAI
架构重点原生全双工语音大模型,可同时倾听与说话全双工语音模型;每秒多次决定听/说/停/打断
语音理解语音与语义联合建模,理解声学环境和用户意图持续处理音频,每秒多次决定说、听、停、打断或调用工具
对话节奏自适应端点检测;用户犹豫时等待,意图完整后快速响应支持附和、抢话、用户思考时静默,并可在说话时调用工具
视觉输入官方将视觉列为后续方向,并非当前 Seeduplex 上线能力GPT-Live 在 ChatGPT 上线时不包含;视频能力官方称后续推进
复杂任务官方发布重点是语音语义、对话节奏与抗干扰能力可把搜索和深度推理委派给后端前沿模型
嘈杂环境官方强调精准抗干扰,并报告误响应与误打断下降官方强调在车流或附近人声中更好地聚焦用户
公开可用性已在豆包 App 全量上线;官方发布页未说明公共 API 可用性已用于 ChatGPT Voice;发布时称 API 后续提供

资料来源:字节 Seed 的豆包实时语音页面与 Seeduplex 发布文章,以及 OpenAI 的 GPT-Live 官方公告。产品可用性会变化,采购前请以官方页面为准。 Seed Realtime Voice 官方页面 · Seeduplex 官方升级说明 · GPT-Live 官方公告

常见问题

SeedRealtime 与 Seed Realtime Voice 常见问题。

直接说明模型命名、Seeduplex 升级、适用场景,以及这个独立 SeedRealtime 网站实际演示什么。

Seed Realtime Voice 是字节跳动 Seed 端到端实时语音模型常见的英文称呼,中文官方名称为“豆包实时语音大模型”。字节 Seed 目前已将该模型标记为升级至 Seeduplex。

SEEDREALTIME / 2026

探索实时语音会话架构。

查看界面概念与浏览器到服务端的链路,判断全双工语音是否适合你的产品。

查看架构