滚动资讯

当前位置：首页 > 资讯 > 人工智能 > 正文内容

AI推理模型受热捧，基准测试费用为何水涨船高？

时间：2025-04-13 11:15:48 来源：ITBEAR编辑：快讯团队 发表评论无障碍通道

随着人工智能技术日新月异的发展，推理AI模型逐渐成为了科研领域的热门焦点。这类模型能够模拟人类的思考过程，尤其在物理学等专业领域，展现出了超越非推理模型的卓越能力。然而，高昂的测试成本却成为了验证这些模型性能的一大障碍。

据第三方AI测试机构“人工智能分析”提供的数据，评估不同推理模型的费用差异显著。以OpenAI的o1推理模型为例，在七个主流的AI基准测试中的评估费用高达2767.05美元，折合人民币约20191元。相比之下，Anthropic的Claude 3.7 Sonnet混合推理模型的评估费用为1485.35美元，折合人民币约10839元。而OpenAI的o3-mini-high模型评估则仅需344.59美元，折合人民币约2514元。尽管存在费用较低的模型，如OpenAI的o1-mini评估费用仅为141.22美元，折合人民币约1030元，但整体来看，推理模型的测试成本依然偏高。

“人工智能分析”机构已投入约5200美元，折合人民币约37945元，用于评估十几种推理模型，这一投入几乎是非推理模型评估费用2400美元的两倍。OpenAI在2024年5月发布的非推理GPT-4o模型评估成本仅为108.85美元，而Claude 3.6 Sonnet的评估成本更是低至81.41美元。该机构的联合创始人乔治·卡梅伦表示，随着推理模型的开发日益增多，测试预算也将相应增加。

AI初创公司“通用推理”的首席执行官罗斯·泰勒也面临着测试成本上升的挑战。他透露，为评估Claude 3.7 Sonnet，使用了约3700个独特的提示词，费用高达580美元。泰勒估计，仅对MMLU Pro进行一次完整测试的成本就可能超过1800美元。他担忧地指出，随着资源投入的差异，学者可能无法复制实验室的报告结果。

推理模型测试成本高昂的主要原因在于其生成的token数量庞大。Token是原始文本的片段，如将单词“fantastic”拆分为多个音节。据“人工智能分析”称，在基准测试中，OpenAI的o1模型生成了超过4400万个token，是GPT-4o生成量的八倍。由于大多数AI公司按token收费，因此成本迅速累积。

现代基准测试包含复杂、多步骤任务的问题，导致模型生成大量token。Epoch AI的高级研究员让-斯坦尼斯拉斯·德内恩指出，尽管每个基准测试的问题数量总体减少，但问题本身更加复杂，旨在评估模型执行现实世界任务的能力，如编写和执行代码、浏览互联网等。最昂贵的模型每百万输出token的成本也在不断增加。例如，Anthropic发布的Claude 3 Opus模型每百万输出token的成本为75美元，而OpenAI的GPT-4.5和o1-pro模型的成本则分别为150美元和600美元。

德内恩表示，尽管随着技术进步，模型的性能提升且成本有所下降，但评估最大最好的模型仍需支付高昂费用。部分AI实验室，包括OpenAI，为测试目的向基准测试组织提供免费或补贴的模型访问权限，但一些专家担忧这可能影响测试结果的公正性。

举报 0 收藏 0 打赏 0评论 0

更多>同类资讯

AI编程助手软件调试能力如何？微软研究揭示其短板

04-13

美教育部长峰会发言出错，竟将AI误喊成A1牛排酱？

04-13

VR/AR/XR文本输入技术繁多，但距实体键盘仍有差距

04-13

苹果携手阿里百度，国行AI版iPhone年中来袭，iOS 18.5将有何惊喜？

中国版 Apple Intelligence 在中国将继续使用苹果的设备端 AI 模型，但会安装由阿里巴巴集团支持的引擎，确保 AI生成的内容符合本地法规，希望在合规和体验之间找到最佳平衡点。苹果计划在…

04-13

马斯克X公司因擅用欧洲用户数据训练Grok遭调查

04-13

Nate购物应用创始人陷欺诈风波：人工操作冒充AI，骗取巨额投资

04-13

OpenAI前员工力挺马斯克：公司重组背弃非营利初心？

04-13

国行iPhone将迎来AI大升级！苹果携手阿里百度，年中前亮相

04-13

华为云生态大会：康宁详解生态繁荣路径，共绘AI时代新蓝图

04-12

字节跳动VAPO框架：Qwen2.5-32B数学推理能力大幅提升，超越Deepseek-R1

04-12

英伟达新推2530亿参数模型，Nemotron Ultra助力AI高效部署

04-12

华为Pura X小艺智能体升级，沉浸式对话体验，让交流更自然

04-12

OpenAI前首席科学家创办公司获20亿融资，估值飙升至320亿美元

04-12

贾跃亭债务再增8.3亿，总金额超13亿，何时回国仍成谜

04-12

国行iPhone将迎AI大升级！苹果携手阿里百度，年中前亮相

04-12

点击查看更多 +

全站最新

特斯拉二手车市场火热，新车销量为何遇冷？

广汽冯兴亚：智驾安全，车企守底线，AEB误触发率降至百万公里一次

广汽昊铂HL上市，家庭智能新豪华SUV，售价26.98万元起享多重福利！

昊铂HL上市：超5米中大型SUV，标配激光雷达，26.98万起售值得入手吗？

夜间远光灯挑战：问界M9智驾夺冠，特斯拉Model Y竟无动于衷？