专栏名称: Founder Park
来自极客公园,专注与科技创业者聊「真问题」。
目录
相关文章推荐
江苏教育发布  ·  厉害了!江苏这群少年登上国家大剧院舞台 ·  14 小时前  
江苏教育发布  ·  厉害了!江苏这群少年登上国家大剧院舞台 ·  14 小时前  
程序猿  ·  离谱!下载 DeepSeek 将判 20 ... ·  昨天  
程序猿  ·  本地部署 DeepSeek ... ·  4 天前  
l 看齐 l  ·  周杰伦,突传新消息! ·  2 天前  
l 看齐 l  ·  周杰伦,突传新消息! ·  2 天前  
上饶新闻  ·  周杰伦,突传消息 ·  3 天前  
上饶新闻  ·  周杰伦,突传消息 ·  3 天前  
51好读  ›  专栏  ›  Founder Park

谷歌版o1来了:思考速度比所有模型快5倍,水平堪比理科博士

Founder Park  · 公众号  ·  · 2024-12-20 09:25

主要观点总结

本文主要介绍了谷歌发布的实验模型Gemini 2.0 Flash Thinking的功能和特点。该模型能够闪电般解决复杂问题并展示思考过程,目前在综合类别指标中排名第一,包括数学、代码、指令跟随、长QA、创意写作等。文章还介绍了该模型的优势,如更易于理解和更透明的推理、原生支持图像上传和分析等。

关键观点总结

关键观点1: Gemini 2.0 Flash Thinking的功能和特点

该模型能够解决复杂问题并展示思考过程,支持多种数据类型处理,包括视觉类谜题,具有快速响应和排名靠前的综合性能。

关键观点2: Gemini 2.0与OpenAI o1的竞争对比

Gemini 2.0通过实验版推出,旨在接受反馈意见,与OpenAI o1系列在功能和透明度上有所区别,旨在进一步改进处理图像的能力。

关键观点3: 模型的透明度和可理解性

通过允许用户了解决策过程,Gemini 2.0解决了人们对人工智能作为“黑匣子”运行的长期担忧,提供了更清晰、更透明的推理过程。

关键观点4: 模型的潜在用例和集成能力

Gemini 2.0 Flash Thinking的多模式能力扩展了其潜在用例,能够应对结合不同类型数据的场景,但目前还不支持与谷歌搜索和其他应用集成。


正文

文章编译自「量子位」、「AI 前线」。

谷歌版o1来了! 在OpenAI十二天发布季倒数第二天——

他们发布Gemini 2.0 Flash Thinking,顾名思义,以闪电般的速度解决复杂问题并展示其思考过程的实验模型。

从姐夫哥展示出的Demo来看,它能在几秒钟之内解决一个物理问题,并且给出思考过程。

还可以给一张图,同时涉及视觉和文本线索的谜题。

如何用其中三个数字加起来等于30?

结果同样也是短短几秒,思考了好几种方案,最终确定是需要将9号球翻转为6号球,以实现6+13+11等于30这样一个结果。

所有综合类别指标中显示,目前Gemini 2.0 Flash Thinking排名第一,包括数学、代码、指令跟随、长QA、创意写作等等各方面。

目前在谷歌AI Studio就可以免费使用。

01

谷歌版o1第一波实测

从众多网友实测中,主要分为两大“派系”,一种是纯文本型,另一种是视觉类谜题。

最明显感知的就是一个快字。

它还可以解决像抛硬币这样的概率问题:如果我一直抛硬币,直到得到HHH或HTH,那么得到这两个几率之比是多少?

甚至它还可以解析摩斯代码 ,让网友直呼:怪吓人的。

有解决这种视觉类谜题的,比如找出这里面的字母和数字,并且说明出现了多少次。

结果它都一一指出来了。

DeepMind首席科学家拿出了他当年面试时遇到第一个问题,是用笔和纸写下的一道关于数论的问题。

结果它也秒秒钟回答了出来。

目前仅支持32k上下文窗口,也不支持联网。不过主创表示接下来会在新的一年里快速跟进,提供更长的token、更多的工具支持等。

今天之所以推出这个实验版,主要是为了接受大家的反馈意见。


02

更易于理解和更透明的推理

在开发者文档中,谷歌解释说,“思考模式的响应推理能力比基础版 Gemini 2.0 Flash 模型更强”,而基础版 Gemini 2.0 Flash 模型是谷歌最新、最出色的模型,仅在 8 天前发布。

新模型仅支持 32000 个标记输入(约 50-60 页文本),并且每个输出响应可以产生 8000 个标记。在 Google AI Studio 的侧面板中,该公司声称它最适合“多模式理解、推理”和“编码”。

该模型的训练过程、架构、许可和成本的完整细节尚未公布。目前,它在 Google AI Studio 中显示每个令牌的成本为零。

与 OpenAI 的竞争推理模型 o1 和 o1 mini 不同,Gemini 2.0 允许用户通过下拉菜单访问其逐步推理,从而更清晰、更透明地了解模型如何得出结论。

通过允许用户了解决策过程,Gemini 2.0 解决了人们对人工智能作为“黑匣子”运行的长期担忧,并使该模型(许可条款仍不明确)与竞争对手的其他开源模型相提并论。


03

原生支持图像上传和分析

Gemini 2.0 Flash Thinking 是对竞争对手 OpenAI o1 系列的进一步改进,旨在处理跳跃中的图像。

o1 最初是纯文本模型,但后来扩展到包括图像和文件上传分析。目前,这两种模型也只能返回文本。

根据开发者文档显示,Gemini 2.0 Flash Thinking 目前还不支持与谷歌搜索落地,也不支持与其他谷歌应用和外部第三方工具集成。

Gemini 2.0 Flash Thinking 的多模式能力扩展了其潜在用例,使其能够应对结合不同类型数据的场景。

例如,在一项测试中,该模型解决了一个需要分析文本和视觉元素的难题,展示了其跨格式集成和推理的多功能性。

开发人员可以通过 Google AI Studio 和 Vertex AI 利用这些功能,其中模型可供实验。

随着人工智能领域的竞争日趋激烈,Gemini 2.0 Flash Thinking 可能标志着问题解决模型新时代的开始。它能够处理多种数据类型、提供可视化推理并大规模执行,这使它成为推理人工智能市场的有力竞争者,可与 OpenAI 的 o1 系列及其他产品相媲美。







请到「今天看啥」查看全文