首页 > 车圈原创 > 车圈原创 > 谷歌AI破译古籍新巅峰:错误率仅0.56%,准确率媲美人类专家

谷歌AI破译古籍新巅峰:错误率仅0.56%,准确率媲美人类专家

发布时间:2025-11-16 14:04:34来源: 13041198719
11 月 16 日消息,科技媒体 golem 昨日(11 月 15 日)发布博文,报道称谷歌通过其 AI Studio 平台,正测试一款尚未命名的 AI 模型,在破译难以辨认的历史手稿方面已接近人类专家的水平。
 
IT之家援引博文介绍,历史学家 Mark Humphries 使用一套专门开发的基准数据集,系统性地测试了该模型的性能。结果表明,在处理五份高难度历史手稿时,该模型的整体字符错误率约为 1.7%,其中大部分错误涉及标点符号和大小写,而非单词本身。
 
 
 
Humphries 的评估进一步指出,如果排除模糊的标点符号和大小写错误,该 AI 模型的字符错误率将骤降至约 0.56%,相当于每转写 200 个字符才出现一个错误。
 
根据新发现的未知 Gemini 型号转录的奥尔巴尼账簿页面
 
这一惊人的准确度,让其性能足以与从事历史文献转写的专业人类工作者相提并论。此次测试的文档涵盖了 18 至 19 世纪的多种手写风格,其中不乏字迹潦草、拼写错误和语法不一致的复杂样本,进一步凸显了该模型的强大能力。
 
该模型最令人意外的表现,是其超越了简单的文字转写,展现出复杂的推理能力。在处理一份 18 世纪商人的日记时,原文中有一条关于购买糖的记录,仅标记了数字“145”,并未注明计量单位。
 
谷歌的 AI 模型并未直接转写为“145”,而是输出了“14 磅 5 盎司”。研究人员发现,AI 是通过反向计算账本中记录的总价,并结合当时英国的货币(磅、先令、便士)与重量单位关系,才成功推断出这一结果。
 
 
 
尽管初步结果令人振奋,但 Humphries 也强调了当前评估的局限性。由于该模型通过 A/B 测试形式零星出现,系统性地进行大规模测试存在困难,目前仅评估了基准数据集中约 10% 的样本。
 

车圈原创更多>>

欧盟委员会正式公布《工业加速法案》(IAA),以“提升低碳转型竞争力”为名,推出严格的战略产业本地含量要求 沃尔沃汽车12月至2月销量下滑10% 在鸿蒙智行技术焕新发布会上,华为产品负责人宣布问界M9全系累计交付量突破28万台 华为乾崑发布最高896线激光雷达,将首搭尊界S800与问界M9 宝马工厂人形机器人,电爪来自中国 奇瑞汽车正式发布瑞虎7L官方图片,新车定位紧凑型SUV,将于2026年一季度正式上市 奔驰GLC终端让利大幅加码,多地经销商报出最高优惠12.5万元,入门版裸车价下探至27万出头 iCAR V27完整配置正式曝光,凭借越级智能与硬核实力,迅速成为硬派方盒子SUV市场焦点 OPPO Find N6真机现身,折痕控制很不错! IDC:智能手机市场恐将因存储芯片供应短缺而下滑13% 魅族确认放弃手机业务:后续聚焦AI驱动软件产品 OPPO Find N6确认配备AI手写笔,其搭载行业首发AI功能! 蓝厂最强旗舰来了!vivo X300 Ultra官宣:全大底三主摄加持 影像灭霸 博通发布多维堆叠芯片平台 高管扬言今明两年能卖出100万颗 百度2.0:一场由AI驱动的核心价值重构 京东APP正式上线「百亿超市」,剑指即时零售 2026年印尼汽车购置激励政策尚未明确,消费者延后购车,政府拟将资金转向国产车开发 3M凭借其材料科学领域的创新技术,正为汽车行业提供更加安全、环保与高效的解决方案 格兰海芬嘉定基地扩产增能项目签约,预计2026年实现产值约4.7亿 新合作!泉州市与宁德时代合作共建智能零碳电池工厂 上海2026汽车以旧换新政策落地,最高补贴2万元 流媒体后视镜风口正劲,华阳前装配套量同比激增近400% 单张不到五毛钱!谷歌深夜发布Nano Banana 2,没有颠覆性,但量大管饱! AI智能体不是越多越强:信息冗余构成了LLM Agent Scaling的瓶颈 特斯拉官宣进军摩洛哥市场,向这个北非国家推出Model 3和Model Y两款车型 保时捷992代911 GT3 RS首台车在越南正式上路 苹果硬抗内存飙升压力!iPhone 18 Pro/Pro Max起售价不变 2025年全球手机存量报告:苹果、三星破10亿断层领先 小米第三 iPhone 17 Pro Max续航测试:WiFi比5G多约3小时使用时长 三星官宣2月26日举办Galaxy Unpacked发布会