首页 > 原创文化 > 原创文化 > 苹果携手剑桥大学设计最佳AI评审框架,突破复杂任务评审局限

苹果携手剑桥大学设计最佳AI评审框架,突破复杂任务评审局限

发布时间:2025-07-24 17:21:03来源: 15210273549

 7 月 24 日消息,科技媒体 NeoWin 今天(7 月 24 日)发布博文,报道称苹果公司携手剑桥大学,提出一种新的 AI 评估系统,通过引入外部验证工具增强 AI 评审员的能力,以提高评审质量。

在评估大语言模型(LLM)时,研究人员和开发者越来越多地借助 AI 力量,这种方式也称为“LLM-as-a-judge”。不过这种方式也存在诸多挑战,在长篇事实核查、高级编码和数学问题等复杂任务中,评估质量往往会下降。

苹果携手剑桥大学发表了一篇新研究论文,概述了一种新系统,通过为 AI 评审员配备外部验证工具,以提高其评审质量,从而克服人类和 AI 注释中的局限性。

人类评审员由于时间限制、疲劳以及更倾向于写作风格而非事实准确性,面临挑战和偏见,而 AI 在上述复杂任务上则遇到困难。

研究人员创建的评估代理是具有自主性的,它能够评估响应以确定是否需要外部工具,并使用正确的工具。每个评估都经过三个主要步骤:初始领域评估、工具使用和最终决策。

事实核查工具使用网络搜索来验证响应中的原子事实;代码执行利用 OpenAI 的代码解释器运行并验证代码的正确性;数学核查工具是代码执行工具的一个专门版本,用于验证数学和算术运算。

如果发现没有工具对判断有帮助,系统将使用基线 LLM 注释器,以避免在简单任务上不必要的处理和潜在的绩效回归。

原创文化更多>>

4月MPV销量榜出炉 岚图梦想家夺冠 魏牌高山冲进前三甲 大众纯电高尔夫推迟至2030年前后上市,SSP平台延期成主因 埃安N60以“128项全系标配”重新定义10万级纯电SUV价值标准的有力宣言 法式大7座SUV真香!标致 5008 智能混动深度试驾! 华为出技术,江淮生产?玛莎拉蒂电车将国产,归属尊界 当别人还在卷充电峰值、卷增程油箱、卷电池容量时,蔚来已经把“补能确定性”变成了销量 吉利银河星耀7 5月22日上市!配雷神AI电混2.0,预售11.28万元起 吉普发布全新牧马人美国250周年特别版,自带美国队长盾牌,这才是他的新座驾 越野圈地震!方程豹豹 8 / 豹 5 闪充版上市,3 轮能开、3 分钟换胎! 吉利银河TT定位中大型轿车,采用纯电动力,车长为4999mm,轴距为2920mm 单月破13万同比大涨70.9%,比亚迪全球化实力全面爆发 全国一口价10.99万元起,和起亚新狮铂拓界纵享初夏好时光 smart 全新一代精灵1号 用激光雷达让小车也配高阶智驾 不跟风、不妥协:212如何用“野”字对抗行业的“卷”? 新款红旗H5和HQ9将于5月20日上市。对心现款车型新款会在内饰部分进行一些升级调整 三大车企一季度财报横评:比亚迪在换挡,吉利在加速,上汽在磨合 订单10万台!30万的大唐“一夜爆红”,越贵的比亚迪越不愁卖? 限时售价8.79万元 配备专属徽章 吉利博越十周年冠军版上市 “8系、9系”扎堆申报,集体冲击高端旗舰 科技比亚迪:以首创之姿筑不可超越之基 1-3月硬派越野销量榜 仅一款销量过万 普拉多第六 销量六连冠,星光730凭什么成为家庭MPV“满分座驾”? 比起“谁更智能”,一汽奥迪强调“把驾驶感抢回来” 15.08万元起!领汇汽车正式推出C级闪充商务轿车e9 五座/七座售价同步揭晓 哈弗猛龙PLUS定档5月15日正式上市 哈弗猛龙PLUS五座版主打宽适空间+硬核越野+全维智能,轻松hold住日常通勤与长途自驾 这4款紧凑型SUV即将上市,家用全能,年轻家庭闭眼选! 零跑并不慌?卖价不到16万的华为全家桶,真的没弱点? 铂智3X的持续爆款、铂智7的强势开局,广汽丰田为什么成为合资车企中最快走上增长正轨的品牌? 预售价39.98万起 智界V9将于5月15日上市 与新款极氪009同台竞技 该选谁?