Gemini 3.8 Live 发布:语音智能体对视觉创作流程意味着什么
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,强调近实时语音对话、视觉接地、多步推理和后台工具调用。对视觉创作者而言,重点不是单次生成效果,而是语音驱动的创作协作流程。
据 Google DeepMind 博客,Google DeepMind 发布了 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,作者为 Tom Ouyang,来源中发布时间为 2026-09-16 01:05。
来源事实:Gemini 3.8 Live 面向规模化和成本效率,结合对话智能、流畅对话和视觉接地;Gemini 3.8 Live Extended Thinking 面向高复杂度任务,强调更强智能和多步推理。DeepMind 称,这些模型可用于构建可靠、可投入生产的语音智能体,并改善 Gemini 应用、Google Workspace 和 Search 中的语音协作体验。
在指标方面,来源称 Gemini 3.8 Live Extended Thinking 在 Artificial Analysis 的 Speech to Speech Quality Index 上得分 82.6,位列总榜第一;在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%;Big Bench Audio 得分为 97.7%。Gemini 3.8 Live 则在 Speech Agent Arena 中位列第二。DeepMind 还提到,ServiceNow 的 EVA-Bench 测试运行于 Gemini Enterprise Agent Platform 上的 Live API。
功能层面,来源称 Gemini 3.8 Live 可近乎实时处理视觉输入,为对话补充上下文,并能在对话中自动检测并在 97 种支持语言之间切换。它还可以在后台执行工具调用和 API 调用,同时继续对话。Extended Thinking 则可“边推理边说话”,用早期口头提示和实时进度叙述维持多步骤任务的连续对话。
AiPix 分析:对视觉创作者来说,这类模型的价值可能不只在“听懂一句提示词”,而在把创作过程变成连续协作:看草图、听反馈、解释修改意图、调用工具并持续推进任务。对于 AiPix 这类围绕 AI Canvas 的图像与视频创作平台,语音、多模态理解和后台工具调用的方向,指向更自然的画布操作体验:创作者可以用口语描述局部修改、素材替换、证件照或婚礼概念生成需求,而系统负责把意图拆解为可执行步骤。
但来源没有提供 AiPix 对这些模型的实测结果,也没有说明其在第三方视觉创作平台中的具体接入效果。因此,更稳妥的判断是:Gemini 3.8 Live 系列显示了语音智能体正在从问答入口转向工作流入口;视觉创作产品若要受益,关键仍在于模型能力、画布工具、任务状态反馈和可控编辑之间的衔接。
来源
- Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended ThinkingGoogle DeepMind:Blog(RSS)
在 AiPix 中继续
把资讯中的能力转化为实际的图片或画布工作流。
打开 AI 画布