期待AGI的人要失望了,GPT-5只是个精心打磨的商业化产品

音符科技网

界面新闻记者 | 伍洋宇

界面新闻编辑 | 文姝琪

从GPT-4刷新人类对AI的认知起,世界曾一度以为走到GPT-5就可能打开通往异世界的大门——等到它真正出现的这天才发现,大模型还在攀爬AGI(通用人工智能)的长梯上,不过多走了两三步而已。

北京时间8月8日凌晨,OpenAI正式发布GPT-5,它的简介是对它亮点的核心概括,但你会发现这些措辞依旧无比熟悉:“这是我们迄今为止最智能、最快、最实用的模型,具有内置思维,可将专家级智能交到每个人手中。

GPT-5是一个统一的系统,包含一个能够解答大多数问题的智能高效模型gpt-5-main,以及一个能够解决更复杂问题的推理模型gpt-5-thinking。

OpenAI通过一个实时路由器,来分析判断用户的对话类型、复杂度、工具需求及其明确意图,比如用户在提示词中写道“认真思考一下”,模型就会切换至thinking版本。 

路由器会根据用户的实际使用情况持续训练,包括用户切换模型的时间、回答偏好率以及准确率测量,并随着时间的推移不断改进。

一旦达到使用限制,每个模型的mini版本将处理剩余的查询任务。是的,它还包括gpt-5-main-mini和gpt-5-thinking-mini,以及专为开发者设置的更加高效的版本gpt-5-thinking-nano。

OpenAI计划在不久之后将这些功能集成到一个模型中。目前,GPT-5面向所有用户开放,Plus会员可获得更多使用量,Pro会员则可访问GPT-5 Pro版本,该版本具有扩展推理能力,可提供更全面、更准确的答案。 

这就是GPT-5的全貌,它基本上一一对应了上一代模型。例如GPT-4o对应gpt-5-main,OpenAI o3对应gpt-5-thinking,包括各自的Pro版本和mini版本。 

从性能上来说,GPT-5最突出的表现围绕“现实世界”而来。OpenAI表示,减少幻觉、提高指令执行能力和减少谄媚是它进展最明显的三个方面。

图自OpenAI官网

在AIME 2025(数学)、SWE-bench Verified(真实世界编码)、MMMU(多模态理解)、GPQA(研究生水平推理)等基准测试中,GPT-5已经是当之无愧的SOTA,甚至在AIME 2025中拿下了100分。

GPT-5还在Humanity's Last Exam(人类最后的知识测试)上超过了自己的ChatGPT Agent。HLE是一个极难的学术级别测试,涵盖数学、自然科学、人文等多个领域的高难度封闭题,ChatGPT Agent在HLE上因为多工具协作和并行策略更有优势,但GPT-5作为单体模型依然拿下不错成绩,这说明它自身有更强的思考能力。

图自OpenAI官网

刷榜是结果但不是目的,正如OpenAI所说,GPT-5能力升级的核心表现就是降低幻觉,更加靠近现实世界。

GPT-5现在可以更准确地回答现实世界的疑问。在ChatGPT生产流量中代表匿名提示的网页搜索中,GPT-5回答包含事实错误的概率比GPT-4o低约45%;在思考时,其*含事实错误概率比OpenAI o3低约80%。这是由于OpenAI添加了新的评估 *** ,以对开放式事实性进行压力测试。

团队测量了GPT- 5在思考开放式事实搜索提示时的幻觉率,这些提示词来自两个公开的事实性基准:LongFact和FActScore。在这些基准测试中,“GPT-5-thinking”的幻觉数量比o3少了约六倍。 

另外,它不会像以前那样谄媚了。与GPT-4o相比,GPT-5的亲切感会有所减弱,不必要的表情符号也更少,后续的互动也会更细腻周到。 

降本增效也很重要。据OpenAI,GPT-5相比OpenAI o3,在视觉推理、 *** 编码和研究生水平的科学问题解决等功能上,输出token数量减少了50%至80%。更关键的是,价格也集体打下来了。

图自Twitter(单位每百万tokens)

在实际应用上,GPT-5把编程能力提升到了新高度。一名AI领域从业人士对界面新闻记者表示,从一些常规测试来看,GPT-5的表现很难评断有多少提升,因为在实际使用中已经很少有人需要从0开始写代码,但对于一些代码修改型任务,它明显会更精准。

另有一名已经使用GPT-5的用户对界面新闻记者表示,其身边人共同探讨的结论是,这次发布可能还是够不上一个大版本更新,“更像是从iPhone 4到iPhone 4S”。

现在局面已经很明确,期待已久的GPT-5大概率会是个成功的商业化产品套组,但它不是如想象般突破AGI进程的要塞,大模型可能已经不是这片战场最有用的武器了。

文章版权声明:除非注明,否则均为音符科技网 wap.luzhiwang.com原创文章,转载或复制请以超链接形式并注明出处。

相关阅读

  • 成都世运会契合中国体育时代之需用多样、多元诠释运动无限可能
  • 特斯拉获批德州网约车牌照 为Robotaxi运营铺平道路
  • 尽管受恶劣天气影响 2025年法国葡萄酒产量或同比增17%
  • “造神”诱惑叠加无竞业束缚 大批量化人才出走华尔街涌向AI初创公司
  • 乐高乐园回应“飞龙过山车短时停运”:被困游客均安全疏散,无人受伤
  • 临沂市新型肺炎确诊病例(临沂市新冠病毒确诊患者)
  • 美国促成阿塞拜疆与亚美尼亚和平协议,特朗普称要充分释放南高加索潜力
  • 由于增长放缓且公司更换首席财务官,The Trade Desk股价暴跌38%
  • 厦门新增10例确诊病例(厦门新增10例确诊病例在哪里)
  • 建功新时代,逐梦向未来——党中央、国务院邀请优秀专家人才代表北戴河休假侧记
  • 欧洲债市:德国国债下跌 市场削减降息押注
  • 午盘:本周三大股指均有望录得涨幅
  • 台胞“安迪叔叔”的大陆厨房:用融合美味交年轻朋友
  • 【新乡疫情/新乡疫情防控不让聚集文件】
  • 北京海淀新增5例感染者/北京海淀新增5例感染者是哪里的
  • 印度总理莫迪邀请俄罗斯总统普京今年晚些时候访问印度
  • 粤游粤好“运”丨当健身日遇上十五运会,一起打卡广东“运动宝藏地”
  • 美国亚特兰大两名交警遭枪击受伤
  • 房利美和房地美股价飙升 受首次公开募股报道刺激
  • 埃及卡塔尔制定新协议,拟促使哈马斯一次性释放人质换撤军
  • 安阳新疫情最新消息,安阳新增4例疫情发布
  • Miran对美联储治理早有一番构思 加盟后或对FOMC产生影响
  • 大难不死的卡德罗夫,一脸憔悴现身说法,身体暴瘦就像变了一个人
  • 胖东来招聘犯过罪的人,是危害顾客安全的炒作吗?
  • 甘肃榆中县山洪灾害救援进展:已累计救出被困群众443人
  • 特朗普警告称法院若作出反关税裁决 经济将衰退
  • 兰州强降雨山洪部分重点地区完成应急调查工作
  • 医保资金不确定性导致美国牙科业务前景下调,永明金融股价大跌8%
  • 甘肃榆中县山洪已累计转移安置9828人
  • 南方网评:风雨与洪流里,凡人挽臂筑堤
  • 埃克森美孚在圭亚那的第四座浮式石油生产装置启动投产
  • 珍酒李渡吴向东直播首秀全网最热,牛市啤酒重磅上新
  • 甘肃榆中:力争8月10日前恢复电力通讯
  • 持续时间长、极端性强,甘肃兰州榆中县本轮强降水有3个特点
  • 【抗战胜利80周年】抗战老兵后人吴军捷忆父奋勇冲锋:抗击日寇死了血也会发光
  • 兰州榆中县山洪灾害新闻发布会:打通抢险救灾“生命线”,力争8月10日前恢复电力通讯
  • 美联储Musalem表示在通胀方面仍未实现目标
  • SoundHound股价跃升 25%,业绩强劲且上调业绩指引
  • 国内期货夜盘收盘涨跌不一,烧碱涨超2%
  • 网传小米、蔚来通过富国银行茅某某向海外转移资金?蔚来相关人士:假消息
  • 目录[+]

    取消
    微信二维码
    微信二维码
    支付宝二维码