环球新资讯:当ChatGPT参加中国高考,把全国A卷B卷喂给它后,竟严重偏科!

2023-05-26 13:05:58 | 来源:夕小瑶科技说

夕小瑶科技说 原创作者 | PythonChatGPT作为一个智能人机对话应用,在推出后迅速风靡全球。仅仅一个月的时间,其用户数量已经突破了一亿大关。人们也用ChatGPT测试了很多考试项目,例如SAT、AP、GRE等。然而,如果让ChatGPT来参加我们中国的高考,会是怎样的一番光景呢?他会不会偏科呢?我们这些普通人又能否考得过ChatGPT呢?且看复旦大学和华东师大的同学们给大家带来的评测。

论文题目:Evaluating the Performance of Large Language Models on GAOKAO Benchmark论文链接:https://arxiv.org/pdf/2305.12474.pdf

如何让ChatGPT解答高考题?

该论文采用零监督prompt的方式,将试题转化为ChatGPT的输入,如下图所示。对于不同的学科和题型,设计了不同的询问方式。对于数学题,则将公式转化为latex输入。


(相关资料图)

高考数据集

本文测试采用2010~2022年,一共13年间的全国A卷和全国B卷,每套试卷包含10门学科,即语数英物化生史地政,其中数学分为理科数学与文科数学。

数据集一共包含2811道试题。具体题型这里就不展开,相信读者们对高考题还是十分了解的。

在评估时,聘请上海市曹杨第二中学的高中老师批阅主观题。

实验与分析

历年高考,ChatGPT取得的分数如下图所示。由于在计算分数时,将每科都归一化到100分,所以这个成绩无法和你我的高考成绩直接比较。但也可以看出,这个分数并不理想,估计无论是复旦还是华东师大都是考不上的。这是为什么呢?

上图展示了ChatGPT在各个学科、以及主客观题上的表现。蓝色为客观题,黄色为主观题。分析发现,ChatGPT对客观题的成绩较好,尤其是英语阅读理解、单选、完形填空,分别取得了88.3%,78.1%,73.8%的准确率。但即使是客观题,理科数学的准确率还不到40%。数学是真的难呀~

主观题上,ChatGPT的表现较差,物理、化学、生物和数学科目中,主观题的表现明显不如客观题。结合理科客观题分数也较差,或许ChatGPT偏向文科?根据阅卷人的评语,ChatGPT主要欠缺在:1.数学问题中的复杂方程难以正确解决,在解题过程中使用了错误的公式。2.阅读较长材料时理解和概括能力不足。

总结

ChatGPT在训练过程中可能没有使用中国高考题数据,因此其表现不受数据泄露的影响,具有较高的可信度。

观察结果显示,与国外考试相比,ChatGPT在中国高考题方面的表现稍逊一筹。因此,国内的学生暂时无需过分担心无法考过ChatGPT。然而,文章中提到的长文本概括能力等在GPT4-32K中有显著改进,国产大模型也在中文数据上做了进一步的优化。因此,我们可以期待未来大模型高考题上取得更瞩目的表现。

此外,用ChatGPT解高考题这个思路,或许可以回答网友们对哪个省的考题更难的争论?

上一篇 下一篇

相关新闻

环球新资讯:当ChatGPT参加中国高考,把全国A卷B卷喂给它后,竟严重偏科!

茶香“出山”飘向全国 当江苏碧螺春工艺遇上贵州千米高山茶_世界快报

天天通讯!Lazada推出电商AI聊天机器人LazzieChat

天天新消息丨文胜湖核心片区将启动城市设计!地铁7号线通达,拟与9号线衔接……

地震武器设计专业排名院校 计算机应用技术专业 焦点快看

推进新一轮电信基础设施共建共享|全球焦点

任务帮平台app大全_任务帮 天天热议

关于长城的故事和传说有哪些_长城的故事和传说介绍 今日精选

即时看!腾讯会议周期性会议室如何使用 腾讯会议周期会议是什么意思

小学转学外省需要办什么手续须知(小学外地转学好转嘛)

广东省职称证书查询入口_广东省职称证书查询|世界即时

武汉简推网络科技有限公司(关于武汉简推网络科技有限公司介绍) 资讯推荐

《疯狂梗传》动物专车让动物上车通关方法

郑煤机(00564)将于7月14日分派末期股息每10股5.60元 每日速讯

全球百事通![快讯]嘉曼服饰公布2022年年度分红实施方案

最新新闻

环球新资讯:当ChatGPT参加中国高考,把全国A卷B卷喂给它后,竟严重偏科!

茶香“出山”飘向全国 当江苏碧螺春工艺遇上贵州千米高山茶_世界快报

天天通讯!Lazada推出电商AI聊天机器人LazzieChat

天天新消息丨文胜湖核心片区将启动城市设计!地铁7号线通达,拟与9号线衔接……

地震武器设计专业排名院校 计算机应用技术专业 焦点快看

推进新一轮电信基础设施共建共享|全球焦点

任务帮平台app大全_任务帮 天天热议

关于长城的故事和传说有哪些_长城的故事和传说介绍 今日精选

即时看!腾讯会议周期性会议室如何使用 腾讯会议周期会议是什么意思

小学转学外省需要办什么手续须知(小学外地转学好转嘛)

广东省职称证书查询入口_广东省职称证书查询|世界即时

武汉简推网络科技有限公司(关于武汉简推网络科技有限公司介绍) 资讯推荐

《疯狂梗传》动物专车让动物上车通关方法

郑煤机(00564)将于7月14日分派末期股息每10股5.60元 每日速讯

全球百事通![快讯]嘉曼服饰公布2022年年度分红实施方案

长城举报比亚迪污染物排放不达标,此前比亚迪曾将魏商标转让给长城汽车-要闻速递

万州区出国务工律师事务所收费标准是多少?

有效整治粮食“跑冒滴漏”

艺考怎么查成绩 快报

长城汽车举报比亚迪秦 / 宋 PLUS DM-i 排放不达标,环境部门予以立案

世界速递!北京发布雷电黄色预警

【双语财讯】中国与东盟企业“走出去”和“引进来”热情不减 全球微资讯

头条焦点:杭州一公司招聘大龄程序员:限45岁以上,不用加班

【世界说】民调:乌瓦尔德校园枪击案一周年 美国控枪呼声达到十年来最高|快播报

电子表格两组数据比对(电子表格比对重复数据) 环球热资讯

每日聚焦:京东酒世界携百城千店开启618

【全球快播报】在“蔚小理”做研发,一年可以赚多少?

【天天快播报】深圳今年第二批次拟出让10宗居住用地

今日热讯:宝马全新5系实拍!尺寸升级+年内国产开售,内饰比E级好看

黑天鹅逼近!惠誉将美国主权信用评级展望下调至“负面” 模型暗示债务违约后评级或被降至AA--世界快看