“大模型”争相涌现，国产AI开启大乱斗，测评国内各种对标ChatGPT的大语言模型-AI奇点网

首页 > 测评 > 文章

2023-05-05 17:30

“大模型”争相涌现，国产AI开启大乱斗，测评国内各种对标ChatGPT的大语言模型

AI奇点网5月4日报道丨转载自知乎 JioNLP团队

最近一段时间，几乎所有国内互联网大中公司都在宣称即将推出、早已深造、启动专项自家的对标 ChatGPT 的大模型。

继百度文心一言发布之后，目前已经推出公测接口的有阿里的通义千问，讯飞的星火大模型，ChatGLM，复旦的 Moss。而其他家都还处于开发或内测阶段，并未开放对外公测。目前各家的效果依然是王婆卖瓜，自说自话，缺乏统一标准。

为了把所有的公测大模型都拉齐到同一个水平线上进行横向比较，我制作了一份 JioNLP-大语言模型评测数据集，用于考察各个大语言模型的实际效果。

LLM 评测数据集简介

jionlp 提供了一份 LLM 评测试题数据集，主要用于评测通用 LLM 的效果评价。

着眼点：考察 LLM 模型对人类用户的帮助效果、辅助能力，可否达到一个方便、可靠的【智能助手】的水平。

题型介绍：选择题来源于中国大陆国内各种专业性考试，日常生活常识，重点在于考察模型对客观知识的覆盖面，占比 52%；主观题主要考察用户对 LLM 常用功能的效果。详细情况如下：

评分规则：

样例

说明

客观题

用户：请回答问题：xxxxxxxx，A，xxx；B，xxx；C，xxx；D，xxx

模型：答案选A，原因是xxxxxx。

覆盖数学、物理、化学、生物、计算机、通信、机械、电力、医学、法律、新闻、地理、历史、文学、经济、编程等方面常识性问题；难易程度不一，存在少量多选题；
若模型给出答案字母（A\B\C\D），但分析结果错误，仍然判定正确；
若模型未给出答案字母，但以文字形式给出正确结果，仍然判定正确；
个别选择题没有正确答案，或题干信息给的不完全，无从给出答案；此时要求模型能够正确辨别题目中的问题，不能给出任何选项答案。此做法考察模型的信息辨别能力，避免幻觉妄语 Hallucination 的能力。
客观题由于模型的输出以概率形式进行采样，具有不确定性。评测过程中，全程都仅做一次输出，不会反复测试以期模型输出正确结果为止。

主观题

加载数据集

jionlp 工具包提供了评测试题数据集，python 语言，使用方式如下：

$ pip install jionlp

>>> import jionlp as jio

>>> llm_test = jio.llm_test_dataset_loader()

>>> print(llm_test[15])

测试结果

其中，ChatGPT 使用的是 3.5 版本，而非 GPT4。得分83分，基本具备了模型作为用户“智能助手”这一职能。扣分点主要在于中文语用和语义的理解偏弱，存在少量编造事实、幻觉妄语（Hallucination）。
而百度的文心一言和讯飞的星火大模型，得分仅为 58分和 54分，在为用户提供有效、客观信息上表现较弱，频繁出现各种信息错误，对于响应用户指令方面也存在一些问题。难以承担一个方便、有效的“智能助手”这一职能。
清华的 ChatGLM 模型采用的是 6B 参数版本，该模型没有对应分数，原因在于该模型无法理解选择题这种出题形式，几乎无法完成评测试题内容，因而不参与打分。等后续出了 120B 版本再参与评测。
以上测试模型结果均有 pdf 版本截图供验证参考。

规划和请求

有一些模型需要提供邀请码才可测试，欢迎大家提供邀请码，或直接使用测试题进行测试。

该测试集将持续跟踪国内其它厂商的大模型效果评测。