• 最新
  • 热门
  • 所有
  • 外汇
  • 24 小时
  • 期货
  • 基金
  • 贵金属
  • 股票
OpenAI最新测试:GPT-5与Claude在部分工作中可媲美人类专家

OpenAI 最新测试:GPT-5 与 Claude 在部分工作中可媲美人类专家

2025 年 9 月 26 日
东方财富期货早餐 11月11日 周二

东方财富期货早餐 11 月 11 日 周二

2025 年 11 月 11 日
微软出奇招:让美国网红带货AI产品 Copilot瞄准年轻消费者

微软出奇招:让美国网红带货 AI 产品 Copilot 瞄准年轻消费者

2025 年 11 月 11 日

影响市场重大事件:我国成功发射试验三十二号卫星 01 星、02 星、03 星;全国首例多源遥感卫星数据资产在晋完成登记

2025 年 11 月 11 日
广告

「新旧消费」 联袂大涨!基金经理发声

2025 年 11 月 11 日
十四届全国人大常委会第十八次会议10月24日至28日将在京举行

公募基金主题投资风格管理指引征求意见 严控风格漂移、集中度过高

2025 年 11 月 11 日
十四届全国人大常委会第十八次会议10月24日至28日将在京举行

进一步激发民间投资活力 13 项政策举措出台

2025 年 11 月 11 日
华尔街顶流私募砍下体育圈首个「大单」:收购西甲豪门马德里竞技

华尔街顶流私募砍下体育圈首个 「大单」:收购西甲豪门马德里竞技

2025 年 11 月 11 日
特斯拉Cybertruck困境加剧?项目负责人宣布离职

特斯拉 Cybertruck 困境加剧?项目负责人宣布离职

2025 年 11 月 11 日
重磅政策!主力抢筹储能 押中多只大牛股(表格)

重磅政策!主力抢筹储能 押中多只大牛股 (表格)

2025 年 11 月 11 日

英伟达 CEO 再访台积电 「讨芯片」,科创半导体 ETF(588170) 上涨 2.12%,冲击 3 连涨

2025 年 11 月 11 日

特斯拉国产 Model Y 长续航后驱版开售;本田下调电动车销售占比目标丨汽车早参

2025 年 11 月 11 日

国际金融市场早知道:11 月 11 日

2025 年 11 月 11 日
金桂财经
广告
2025 年 11 月 11 日 星期二
联系我们
合作建议
  • 首页
  • 24 小时
  • 全球金融
  • 股市风云
  • 基金动态
  • 金财眼
  • 期货新闻
  • 期货研报
  • 外汇市场
  • 贵金属
  • 未来科技
  • 登录& 注册
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 全球金融
  • 股市风云
  • 基金动态
  • 金财眼
  • 期货新闻
  • 期货研报
  • 外汇市场
  • 贵金属
  • 未来科技
没有结果
查看所有结果
金桂财经
没有结果
查看所有结果

OpenAI 最新测试:GPT-5 与 Claude 在部分工作中可媲美人类专家

来自 金桂财经
2025 年 9 月 26 日
在 全球
0

YOU MAY ALSO LIKE

微软出奇招:让美国网红带货 AI 产品 Copilot 瞄准年轻消费者

华尔街顶流私募砍下体育圈首个 「大单」:收购西甲豪门马德里竞技

  当地时间周四 (9 月 25 日),人工智能(AI) 研究公司 OpenAI 发布了一项新的基准测试,用于比较其 AI 模型与各行业专业人士的工作表现。

  这项测试名为 GDPval,是一次初步尝试,旨在评估 OpenAI 的系统距离在经济价值工作上超越人类有多近。而经济价值工作是 OpenAI 开发通用人工智能(AGI) 的关键环节。

  OpenAI 周四表示,其 GPT-5 模型以及竞争对手 Anthropic 公司的 Claude Opus 4.1「已经接近行业专家的工作质量」。

  这并不意味着 OpenAI 的模型会立刻取代人类工作。尽管一些 CEO 预测 AI 在几年内就会取代人类,但 OpenAI 承认 GDPval 目前只涵盖人们实际工作中有限的一部分任务。不过,这是该公司用来衡量 AI 向这一里程碑迈进的最新方式之一。

  GDPval 基于美国 GDP 贡献最大的九个行业,包括医疗、金融、制造业和政府等领域。测试覆盖了 44 种职业,从软件工程师到护士再到记者。

  在首个版本 GDPval-v0 中,OpenAI 邀请资深专业人士对比 AI 生成的报告与其他专业人士的成果,并挑选出更优者。

  例如,某项任务要求投行人员为 「最后一公里配送行业」 制作竞争格局分析,并与 AI 生成的报告进行对比。OpenAI 随后将 AI 模型在全部 44 个职业中对抗人类报告的 「胜率」 进行平均计算。

  结果显示,GPT-5-high(高算力版本 GPT-5) 在 40.6% 的情况下被评为优于或与行业专家持平。

  而 Anthropic 的 Claude Opus 4.1 模型则在 49% 的任务中被评为不输于行业专家,这一表现超过了 OpenAI 的模型。

  OpenAI 对此解释称,之所以 Claude 得分更高,部分原因是其倾向于生成更美观的图表,而非纯粹性能更优。

  需要说明的是,大多数职业的工作远不止提交研究报告,而这却是 GDPval-v0 所测试的全部内容。OpenAI 承认这一点,并计划在未来开发更全面的测试,涵盖更多行业和交互式工作流程。

  尽管如此,OpenAI 仍认为 GDPval 的进展具有重要意义。

  OpenAI 首席经济学家 Aaron Chatterji 在接受采访时表示,GDPval 的测试结果表明,这些岗位上的人们可以利用 AI 模型节省时间,从而专注于更有意义的工作。

  「因为模型在某些事情上已经变得很擅长,随着能力的提升,人们可以越来越多地把部分工作交给模型,去做潜在更有价值的事情,」Chatterji 说。

  OpenAI 评估负责人 Tejal Patwardhan 表示,她对 GDPval 的进步速度感到鼓舞。

  Patwardhan 指出,约 15 个月前发布的 GPT-4o 模型得分仅为 13.7%(胜出或持平人类),而 GPT-5 的成绩几乎提高了三倍。她预计这一趋势还会继续。

(财联社)

文章转载自 东方财富

Search

没有结果
查看所有结果

一周热门

东方财富期货早餐 11月11日 周二

东方财富期货早餐 11 月 11 日 周二

2025 年 11 月 11 日
微软出奇招:让美国网红带货AI产品 Copilot瞄准年轻消费者

微软出奇招:让美国网红带货 AI 产品 Copilot 瞄准年轻消费者

2025 年 11 月 11 日

影响市场重大事件:我国成功发射试验三十二号卫星 01 星、02 星、03 星;全国首例多源遥感卫星数据资产在晋完成登记

2025 年 11 月 11 日

「新旧消费」 联袂大涨!基金经理发声

2025 年 11 月 11 日
十四届全国人大常委会第十八次会议10月24日至28日将在京举行

公募基金主题投资风格管理指引征求意见 严控风格漂移、集中度过高

2025 年 11 月 11 日
十四届全国人大常委会第十八次会议10月24日至28日将在京举行

进一步激发民间投资活力 13 项政策举措出台

2025 年 11 月 11 日
华尔街顶流私募砍下体育圈首个「大单」:收购西甲豪门马德里竞技

华尔街顶流私募砍下体育圈首个 「大单」:收购西甲豪门马德里竞技

2025 年 11 月 11 日
特斯拉Cybertruck困境加剧?项目负责人宣布离职

特斯拉 Cybertruck 困境加剧?项目负责人宣布离职

2025 年 11 月 11 日
重磅政策!主力抢筹储能 押中多只大牛股(表格)

重磅政策!主力抢筹储能 押中多只大牛股 (表格)

2025 年 11 月 11 日

英伟达 CEO 再访台积电 「讨芯片」,科创半导体 ETF(588170) 上涨 2.12%,冲击 3 连涨

2025 年 11 月 11 日
金桂财经

2025 年 11 月
一 二 三 四 五 六 日
 12
3456789
10111213141516
17181920212223
24252627282930
« 10 月    

近期动态

  • 东方财富期货早餐 11 月 11 日 周二
  • 微软出奇招:让美国网红带货 AI 产品 Copilot 瞄准年轻消费者
  • 影响市场重大事件:我国成功发射试验三十二号卫星 01 星、02 星、03 星;全国首例多源遥感卫星数据资产在晋完成登记
  • 「新旧消费」 联袂大涨!基金经理发声
  • 公募基金主题投资风格管理指引征求意见 严控风格漂移、集中度过高
  • 进一步激发民间投资活力 13 项政策举措出台
广告

Copyright © 2025 广州金桂广告传媒有限公司. 粤 ICP 备 2025390655 号

  • 关于本站
  • 联系我们
  • 隐私政策
没有结果
查看所有结果
  • 登录& 注册

Copyright © 2025 广州金桂广告传媒有限公司. 粤 ICP 备 2025390655 号

  • 登录
  • 注册
忘记密码?
Lost your password? Please enter your username or email address. You will receive a link to create a new password via email.
body::-webkit-scrollbar { width: 7px; } body::-webkit-scrollbar-track { border-radius: 10px; background: #f0f0f0; } body::-webkit-scrollbar-thumb { border-radius: 50px; background: #dfdbdb }