Gemini 3.8 Flash智能评分59分,输入价维持每百万Token 0.75美元


Google(谷歌)周三上线 Gemini 3.8 Flash:这款新模型在独立智能指数中的得分达到 59 分,性能对标前沿系统,但 Token 价格仅为其一小部分;同时公司还发布了权限更严的网络安全版本。

Gemini 3.8 Flash 基准测试表现

谷歌在 9 月 2 日发布了两款新模型,这是六周内第三次迭代 Flash 系列。两者都基于同一底层系统,训练数据中网络安全相关内容占比较高。

其中一款面向代码生成与智能体(agent)场景,另一款则在严密访问控制下,专注于在超大代码库中挖掘软件漏洞。

在高推理模式下,Gemini 3.8 Flash 在 Artificial Analysis Intelligence Index 上取得 59 分,比 3.7 Flash 高 3 分,与 GPT-5.6 Sol 和 Grok 4.6 处于同一档位。在 HLE-Verified(覆盖理工、人文及专业领域的多步推理评测)中得分 54.9%。谷歌强调,长周期的软件工程任务是本次性能提升最突出的领域。

公司宣布,至 12 月 31 日前,输入 Token 价格维持每百万 0.75 美元,输出 Token 维持每百万 3.75 美元;从元旦起,这两项价格将同步翻倍。

为何 Gemini 单任务成本反而上升

Token 更便宜,并不意味着任务更便宜。按公开测试测算,Gemini 3.8 Flash 单个基准任务成本约为 0.58 美元,比上一代高约 40%。原因在于平均输出长度增加了约 30%,达到约 4.8 万 Token,同时智能体运行需要更多往返轮次。

来自 Anthropic 的旗舰模型在单任务成本上仍高出接近六倍,令谷歌在成本曲线上依然处于“前沿位”。

谷歌 DeepMind 高级产品总监 Tulsee Doshi 与 Gemini 安全负责人 Raluca Ada Popa 表示,新模型在推理过程中“更勤奋”,会增加推理步骤并多次调用工具。对成本更敏感、希望保持旧成本结构的团队,可以继续停留在 3.7 Flash 上;而 Pro 与 Ultra 用户则可通过 Gemini 应用、AI 模式以及 Google Sheets 直接接入新模型。

Fairwind Program 严控网络安全版本准入

网络安全版本被置于全新的 Fairwind Program 之下,仅向通过审查的政府机构、关键基础设施运营方以及核心软件维护者开放。

在覆盖 20 种编程语言的内部测试中,该版本的漏洞识别成功率超过 70%。谷歌称,Chrome 安全部门借助该系统产出的正确补丁数量,是体量更大的商业竞品的 2.6 倍。一支云安全研究团队则在不到两小时内追踪到一个关键漏洞,而以往类似工作往往需要耗时数月。

快速迭代背后,是谷歌 AI 业务此前经历的一段艰难期:原定 6 月落地的 Gemini 3.5 Pro 未能如期上线。

8 月初,Demis Hassabis 宣布卸任 DeepMind 首席执行官,转任董事长一职,由 Koray Kavukcuoglu 接棒日常管理,头衔则为级别略低的高级副总裁。

本文链接地址:https://www.wwsww.cn/rgzn/41032.html
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。