当地时间周四(9月25日) ,人工智能(AI)研究公司OpenAI发布了一项新的基准测试,用于比较其AI模型与各行业专业人士的工作表现。
这项测试名为GDPval,是一次初步尝试,旨在评估OpenAI的系统距离在经济价值工作上超越人类有多近 。而经济价值工作是OpenAI开发通用人工智能(AGI)的关键环节。
OpenAI周四表示 ,其GPT-5模型以及竞争对手Anthropic公司的Claude Opus 4.1“已经接近行业专家的工作质量”。
这并不意味着OpenAI的模型会立刻取代人类工作。尽管一些CEO预测AI在几年内就会取代人类,但OpenAI承认GDPval目前只涵盖人们实际工作中有限的一部分任务 。不过,这是该公司用来衡量AI向这一里程碑迈进的最新方式之一。
GDPval基于美国GDP贡献最大的九个行业 ,包括医疗、金融 、制造业和政府等领域。测试覆盖了44种职业,从软件工程师到护士再到记者 。
在首个版本GDPval-v0中,OpenAI邀请资深专业人士对比AI生成的报告与其他专业人士的成果 ,并挑选出更优者。
例如,某项任务要求投行人员为“最后一公里配送行业 ”制作竞争格局分析,并与AI生成的报告进行对比。OpenAI随后将AI模型在全部44个职业中对抗人类报告的“胜率”进行平均计算 。
结果显示 ,GPT-5-high(高算力版本GPT-5)在40.6%的情况下被评为优于或与行业专家持平。
而Anthropic的Claude Opus 4.1模型则在49%的任务中被评为不输于行业专家,这一表现超过了OpenAI的模型。
OpenAI对此解释称,之所以Claude得分更高 ,部分原因是其倾向于生成更美观的图表,而非纯粹性能更优 。
需要说明的是,大多数职业的工作远不止提交研究报告,而这却是GDPval-v0所测试的全部内容。OpenAI承认这一点 ,并计划在未来开发更全面的测试,涵盖更多行业和交互式工作流程。
尽管如此,OpenAI仍认为GDPval的进展具有重要意义 。
OpenAI首席经济学家Aaron Chatterji在接受采访时表示 ,GDPval的测试结果表明,这些岗位上的人们可以利用AI模型节省时间,从而专注于更有意义的工作。
“因为模型在某些事情上已经变得很擅长 ,随着能力的提升,人们可以越来越多地把部分工作交给模型,去做潜在更有价值的事情 ,”Chatterji说。
OpenAI评估负责人Tejal Patwardhan表示,她对GDPval的进步速度感到鼓舞。
Patwardhan指出,约15个月前发布的GPT-4o模型得分仅为13.7%(胜出或持平人类) ,而GPT-5的成绩几乎提高了三倍 。她预计这一趋势还会继续。
(文章来源:财联社)
在线股票配资查询门户:配资炒股股票-ChatGPT-5上线遭“滑铁卢” OpenAI回归GPT-4o
国内十大炒股杠杆平台:怎么使用杠杆买股票-周末要闻汇总:央行最新货币政策报告释放重要信息
炒股配资知识网:股票配资网首页官网-国务院国资委最新部署:深入应用人工智能等技术 加大力度推动“三化”转型
正规的股票交易app:民间配资炒股-8月19日国内四大证券报纸、重要财经媒体头版头条内容精华摘要
炒股里杠杆什么意思:股票杠杆查询-组合需要适度均衡 部分私募“不想跟科技股玩了”
买股票多少钱可以开户:炒股杠杆app-61岁李在明执掌韩国 中韩关系有何变化?专家:有望回暖
正规股票杠杆平台_股票配资炒股公司_正规股票配资炒股平台提示:文章来自网络,不代表本站观点。
在红利策略持续受关注的这几年,银行股始终是该策略权重占比显著的核心配置板块和标志性配置方向。随着二季报披露,竟有红利...
3月24日,业内权威专家表示,MLF(中期借贷便利)不再有统一的中标利率,标志着MLF利率的政策属性完全退出。3月24日...
记者|赵阳戈年初,证监会就修改《证券发行与承销管理办法》部分条款向社会公开征求意见,市场也将注意力投向了...
【隔夜行情】•周五(2025年3月21日),A股三大指数集体下跌,截至收盘,截止收盘,沪指跌1.29%,报收33...
记者王珍中国国际经济交流中心副理事长、国务院发展研究中心原副主任王一鸣周一在“中国发展高层论坛2025...