人工智能竞争正在从性能转向价格。谷歌推出新模型“Gemini 3.7 Flash”,在提升性能的同时将使用费减半。距离上一代3.6 Flash发布仅3周。
Gemini 3.7 Flash是一款聚焦编码和代理任务的模型。所谓代理,是指只要人类设定目标,人工智能就能自动处理多个步骤的工作。它可以自行查找资料、制作文档,甚至修复程序。
Flash是谷歌Gemini产品线中主打速度和价格的实用型系列。虽然比最高性能模型更轻量,但因价格更低,最常被用于实际服务。谷歌将这款新模型介绍为“最聪明的干活模型”。

提升幅度最大的部分是编码能力。在衡量查找并修复软件错误能力的评估DeepSWE中,它获得65.3分,而上一代为49.0分。在衡量生成实务级代码的FrontierCode评估中,也以43.6分领先上一代的34.4分。

制作类似主页的网页界面能力也有所提升。在用户对两个模型生成结果进行比较并选择更好一方的排名方式中,它比上一代高出50分。这意味着当给出图片或设计草图时,它能更准确地还原出相似的画面。

在金融、法律、生物科学等需要专业知识的领域,得分也有所提升。在阅读复杂文档并理解内容的评估中,它拿到34.0分,较上一代的22.0分进一步拉开差距。在衡量实际公司业务处理能力的评估中,也从17.0分跃升至30.4分。虽然仍离满分很远,但提升幅度相当明显。
谷歌公开的应用案例具体展示了变化。只要用文字说明,就能即时生成角色和道具的3D游戏。一次指令就完成会动的网页首页的案例也被展示出来。将数百页的年度报告转化为图表动态呈现的网页文档的演示也一并公开。
第一次尝试就能给出正确结果的比例提高,对开发现场意义重大。人工智能生成的代码如果出错,人类就得让它重新修改。减少这种反复,开发时间和使用费用都会下降。谷歌解释称,新模型在遇到阻碍时会自动寻找替代路径,并在指令含糊时主动追问,这方面已有改进。
本次发布最引人注目的还是价格。使用费到年底为止,输入每100万token 0.75美元,输出每100万token 3.75美元。相比上一代的发布价格,直接减半。token是人工智能读写文本时计算的单位,100万token大致相当于多部长篇小说的篇幅。
人工智能模型的使用费直接关系到服务成本。不论是翻译应用还是客服聊天机器人,嵌入AI功能的服务每次被用户使用时,都要向模型公司支付费用。模型价格减半后,同样的预算可以运行两倍的量,或者有空间下调服务收费。
对于没有自研模型的韩国企业来说,这是一个机会。越能低价借用优秀模型,就越能把竞争空间转向创意和服务策划。相反,对于直接开发模型的企业,则压力更大了。它们如今必须在性能和价格两条战线上同时竞争。

发布间隔也在缩短。上一代与本次模型之间仅隔了3周。这表明开发者意见正被迅速反映到下一代模型中。从整个行业来看,模型更替周期正从按季度缩短到按周计算。
人工智能模型使用得越多,可改进的数据和素材就越多。先把开发者吸引到自己的阵营,服务就会建立在该模型之上。一旦服务已经搭建起来,再迁移到其他模型就很麻烦。即便短期利润减少,扩大用户基础仍然是更划算的战略。

使用范围因对象而异。开发者可从谷歌AI开发工具上线当天起使用;企业则通过谷歌企业级AI服务导入;在Gemini应用中,则从Pro和Ultra订阅用户开始适用。免费用户暂时仍使用上一代3.6 Flash。
面向订阅用户的个人助理功能“Spark”也从当天起切换为新模型。Spark是让用户预先指定任务后,由其全天24小时自动处理的功能,例如整理分散的文件、撰写邮件草稿、更新进度文档等。无需额外设置,可在160多个国家使用。
谷歌文档和电子表格等办公工具的处理能力提升,是Spark改进的核心。需要在多个应用之间切换完成的工作,原本更容易被人工智能在中间环节出错。工具操作准确度提高后,用户逐一检查结果的负担将减轻。
谷歌表示,已强化防止生化、核相关滥用以及黑客滥用的安全措施。随着性能提升,被用于恶意用途的风险也会增加,因此安全机制的水平,如今也成为选择模型时必须考量的因素。
半价价格只在年底前有效,之后的收费尚未确定。如果企业在导入初期只看低价而搭建服务架构,一旦费用上涨,成本计划可能会被打乱。性能评估分数也要考虑到,这是谷歌自行挑选的指标。是否真正适合实际业务,仍需各自试用后判断。
对于准备导入人工智能的企业来说,现在正是评估取舍的时点。在模型价格快速下行的阶段,与其把服务绑定在某一个模型上,不如提前设计成可随时切换模型的架构,更为有利。