DeepMind为Gemini推出 agentic video understanding,补齐视频理解动作能力

DeepMind在官方博客发布Gemini的“agentic video understanding”能力,表示Gemini开始把视频理解从单纯问答推进到可执行任务的交互式处理,面向需要解析长视频、定位关键片段、总结事件线索和继续追问的用户与开发者。相比以往只回答“视频里发生了什么”的模式,这次更新把视频识别、语义提取和后续操作连成一条链条,也让Gemini在多模态能力上更接近可直接上手的工作流助手。据DeepMind Blog报道。

来源:DeepMind Blog

原始发布时间:2026年9月2日 01:08