上海研发的“书生·浦语”大语言模型发布

2023-06-08 00:38:50 来源:澎湃新闻

上海研发的“书生·浦语”大语言模型发布

6月7日,上海人工智能实验室(上海AI实验室)、商汤科技联合香港中文大学、复旦大学及上海交通大学发布千亿级参数大语言模型“书生·浦语”(InternLM)。

随着AI大语言模型越来越多地表现出接近人类的智能,面向人类设计的高难度、综合性考试被越来越多地引入对语言模型的智能水平进行评测。OpenAI在其关于GPT-4的技术报告中就主要通过各领域的考试对模型能力进行检验。2023年高考开考,中文大语言模型是否能够在高考中赶超ChatGPT呢?

据上海人工智能实验室介绍,“书生·浦语”具有1040亿参数,是在包含1.6万亿token的多语种高质量数据集上训练而成。全面评测结果显示,“书生·浦语”不仅在知识掌握、阅读理解、数学推理、多语翻译等多个测试任务上表现优秀,而且具备很强的综合能力,因而在综合性考试中表现突出,在多项中文考试中取得超越ChatGPT的成绩,其中就包括中国高考各科目的数据集(GaoKao)。


(资料图)

综合“大考”:“书生·浦语”多项成绩领先于ChatGPT

“书生·浦语”联合团队选取了20余项评测对其进行检验,其中包含全球最具影响力的四个综合性考试评测集:由伯克利加州大学等高校构建的多任务考试评测集MMLU;微软研究院推出的学科考试评测集AGIEval(含中国高考、司法考试及美国SAT、LSAT、GRE 和 GMAT等);由上海交通大学、清华大学和爱丁堡大学合作构建的面向中文语言模型的综合性考试评测集C-Eval;以及由复旦大学研究团队构建的高考题目评测集Gaokao。

实验室联合团队对“书生·浦语”、GLM-130B、LLaMA-65B、ChatGPT 和 GPT-4 进行了全面测试,针对上述四个评测集的成绩对比。

研究发现,“书生·浦语”不仅显著超越了GLM-130B和LLaMA-65B 等学术开源模型,还在AGIEval、C-Eval、以及Gaokao等多个综合性考试中领先于ChatGPT;在以美国考试为主的MMLU上实现和 ChatGPT 持平。这些综合性考试的成绩反映出“书生·浦语”扎实的知识掌握程度和优秀的综合能力。

虽然 “书生·浦语”在考试评测上取得优秀成绩,但在测评中也可以看到,大语言模型仍然存在不少能力局限性。“书生·浦语” 受限于2K的语境窗口长度(GPT-4的语境窗口长度为32K),在长文理解、复杂推理、撰写代码以及数理逻辑演绎等方面还存在明显局限。另外,在实际对话中,大语言模型还普遍存在幻觉、概念混淆等问题;这些局限使得大语言模型在开放场景中的使用还有很长的路要走。

分项评测:阅读理解、推理能力表现出色

为了避免“偏科”,研究人员还通过多个学术评测集,对“书生·浦语”等语言模型的分项能力进行了评测对比。结果显示,“书生·浦语”不仅在中英文的阅读理解方面表现突出,并且在数学推理、编程能力等评测中也取得了较好的成绩。

例如,在知识问答方面,“书生·浦语”在TriviaQA 和 NaturalQuestions 两项评测上得分为69.8和27.6,均超越 LLaMA-65B(得分为68.2和23.8,满分100分)。

在阅读理解(英语)方面,“书生·浦语”明显领先于 LLaMA-65B 和 ChatGPT。浦语在初中和高中英语阅读理解中得分为92.7和88.9,⽽ChatGPT得分为85.6和81.2,LLaMA-65B则更低。

在中文理解方面,“书生·浦语”的成绩全面超越主要的两个中文语言模型ERNIE-260B和GLM-130B。在多语翻译方面,“书生·浦语”在多语种互译中的平均得分为33.9,显著超越LLaMA(平均得分15.1)。

在编程能力方面,“书生·浦语”在HumanEval 和MBPP这两项最具代表性的考评中,分别取得28.1和 41.4的得分(其中经过在代码领域的微调后,在HumanEval上的得分可以提升至45.7),明显领先于 PaLM-540B(得分为 26.2 和 36.8)与LLaMA-65B(得分为 23.7 和 37.7)。

此外,研究人员还对“书生·浦语”的安全性进行评测,在TruthfulQA(主要评价回答的事实准确性) 以及 CrowS-Pairs(主要评价回答是否含有偏见)上,“书生·浦语”均达到领先水平。

标签:

上海研发的“书生·浦语”大语言模型发布

2023-06-08

2023世界人工智能大会主题和主视觉发布,将于7月6—8日在上海举办 世界快资讯

2023-06-08

6月7日国内主要交易市场现货锌价汇总-全球新要闻

2023-06-08

环球快资讯丨为什么短视频推广越来越重要了?

2023-06-07

《海南往事》第十八期:这栋带有金色字匾的骑楼,你知道它的故事吗?

2023-06-07

第五元素里面所有的歌曲?

2023-06-07

七旬村民被村支书打住院,数月无人管?当地副镇长:正处理

2023-06-07

民勤:高考第一天 考场外温暖的目送 播资讯

2023-06-07

莴笋怎么去皮都能吃吗|全球通讯

2023-06-07

迎来送往的人生_迎来送往的意思

2023-06-07

腾讯视频会员免费领取最新活动教程2022 全球快资讯

2023-06-07

商洛商南百鸡村开展“医心向党·健康惠民”大型义诊活动 每日热门

2023-06-07

微信暖心的心情文案

2023-06-07

前沿资讯!今年立法工作计划公布,未提个税、房地产税法,重头戏是这些

2023-06-07

微头条丨【收盘前半小时】A股主力资金净流出54.78亿元

2023-06-07

天天快看点丨隽诺实现日产200吨RDF替代燃料,高效助力绿色循环碳减排!

2023-06-07

“废”中寻宝,汽车拆解回收市场将突破千亿大关!

2023-06-07

世界今头条!智立方06月07日主力资金大幅流出

2023-06-07

今亮点!金评天下|激活资本市场 分流银行存款

2023-06-07

“黑马房企”,退市!

2023-06-07

朱雀基金增持金力永磁(06680)11.08万股 每股作价17.12港元

2023-06-07

焦点!二阳状况出现新冠长期存在 连花清瘟适合家庭常备

2023-06-07

世界新动态:“文化润疆”中的艺术力量

2023-06-07

金店回收黄金多少钱一克(2023年6月7日)

2023-06-07

全球简讯:区卫生健康局细化高考保障措施护航考生健康

2023-06-07

【天天热闻】学子奔赴考场!新高考分为“3+3”和“3+1+2”选考模式

2023-06-07

环球热门:每人每天的食盐摄入量初中化学_每人每天的食盐摄入量不超过

2023-06-07

重庆警方破获一电镀厂特大污染环境案|当前快报

2023-06-07

环联调查:旅游及消费恢复 香港信贷市场显著复苏-世界微速讯

2023-06-07

快看点丨5月全国城市轨道交通客运量24.9亿人次

2023-06-07

Copyright ©  2015-2022 东方频道网版权所有  备案号:沪ICP备2020036824号-8   联系邮箱:562 66 29@qq.com