您现在的位置是:首页 > 业界业界
科大讯飞解锁常识推理新成就,让机器“能理解会思考”
cc博主2022-04-15【业界】490人已围观
4月12日,由科大讯飞承建的我国首个认知智能国家重点实验室,以76.06%的成绩登顶常识推理挑战赛CommonsenseQA 2.0,刷新世界纪录,在让机器“能理解、会思考”上迈出一大步!
CommonsenseQA 2.0是艾伦人工智能研究院(Allen Institute for AI)于2021年主导发布的国际常识推理评测数据集,旨在评估机器对常识知识的理解及掌握水平,吸引了包括Google、Allen Institute for AI、华盛顿大学等众多国际顶尖机构参与挑战。科大讯飞首次参赛,即创新性地提出ACROSS模型,以全新深度学习算法绝对优势,刷新机器常识推理水平世界纪录。
从做“选择题”到做“判断题”,机器学会常识推理有多难?
常识推理(Commonsense Reasoning)是 NLP 最重要的前进方向之一,其目的是帮助计算机学习常识知识,并利用所掌握的知识进行深层次的理解及推理。该领域的进展及技术突破对人工智能发展具有重要的意义。
当前典型的阅读理解模型所关注的问题类型主要是事实类问题,这类型的问题答案往往能直接在原文中找到,然而如何基于常识和背景知识进行推理以获得答案仍旧是一个巨大的挑战。
CommonsenseQA正是为了训练机器像人类一样基于先验知识结合现实情况作答能力而设置的数据集。当人们回答问题时,往往会利用自身了解的知识结合特定的背景来判断问题答案。比如常识、背景知识、空间关系、科学事实、社会惯例等。
CommonsenseQA 1.0任务示例
如上图任务示例中的第二个问题,“我可以站在河上的什么地方看水流而不会弄湿自己?”可以从选择项中推断我是在桥上。这种知识对人类而言似乎很好理解,但是如何让机器学会常识及背景知识并进行准确推理,仍然是一个巨大的挑战。
CommonsenseQA 2.0是一个二元分类数据集,包含14343个问题,主要分为训练/开发/测试集,需要判断常识性陈述是对还是错。1.0版本所考察的问题,是基于现有常识知识库ConceptNet中的知识三元组构建的,这使得机器在处理该任务时,有能直接聚焦参考的知识。相比较1.0的“选择题”,2.0“判断题”挑战难度更高,仅给定一个主题实体或概念、一个常识类关系(且关系不一定在现有知识库出现),让人类以自然语言的方式去构造机器较难掌握的常识知识。
该构造方法所构造的常识推理问题具有庞大的想象空间,大部分在当前知识库中并未覆盖,无疑显著增加了机器处理该类问题的难度。同时,该评测任务数据构造过程中,还通过人与机器不断博弈对抗的方式,不断迭代设计,最终确定的问题集合基本是当前主流算法都完成得不好的问题。
目前以科大讯飞为代表的中国人工智能力量在常识推理领域中已有很大的进步,但是仍远低于人类94.1%的水平,可见在常识性推理方向仍有很大挑战和进步空间。
CommonsenseQA 2.0任务问题示例
CommonsenseQA 2.0任务所覆盖的常识问题类型示例
科大讯飞提出ACROSS创新方法破解难题
在CommonsenseQA 2.0这项颇具挑战的常识推理评测任务上,业界主流的中等大小预训练模型方法也只能取得55%的水平,略高于随机猜测平均水平。此前国际上该任务的最优方法,通过1750亿级参数量大小的GPT3模型生成针对CommonsenseQA 2.0常识推理问题的相关知识,并基于T5模型进行融合处理,该方法取得了73%的准确率。
本次由科大讯飞承建的认知智能国家重点实验室团队创新提出的面向常识知识推理的ACROSS(Automatic Commonsense Reasoning on Semantic Spaces)模型,是继2016年科大讯飞提出神经联想模型NAM(Neural Association Model),并取得Winograd Schema Challenge冠军后的又一力作。
该模型实现了统一语义空间下外部知识的有效融合,显著改进了超大规模预训练模型所存在的问题,在CommonsenseQA 2.0任务上取得76%的准确率。
该评测的常识推理问题,不论在ConceptNet等知识库,或者互联网上,都较难找到直接的答案。从人类进行常识知识运用及推理的习惯出发,对于一个复杂的问题,首先需要查阅相关知识库或典籍,其次会借助互联网搜索去查找相关信息。ACROSS模型正是借鉴该思路,充分收集知识库、互联网相关信息,在统一的语义空间中进行融合处理,最后赋予超大规模预训练模型更强的知识输入,实现准确的常识知识推理。该方法结果也一定程度上证明了机器已初步具备对于各类复杂文本信息及知识的深入理解及运用能力。
我国在常识推理领域的技术攻坚还在继续。
人工智能技术的下一步发展,必须要突破常识推理这一瓶颈,才能在教育、医疗、养老等国计民生场景中,让人工智能产品更具备实用价值。
“让机器能听会说、能理解会思考”是清晰可预见的未来,科大讯飞求索未止。
雷峰网(公众号:雷峰网)
Tags:shadowsocksr下载
相关文章
猜你喜欢
2022 年“微软学者”奖学金名单公布,中国高校 10 人入选
人工智能作者 | 李梅编辑 | 陈彩娴10 月 6 日,“微软学者”奖学金获得者名单公布。本年度,共有来自亚太地区的 12 名优秀博士生最终被授予 2022 年“微软学者”称号。中国共有 6 所高校入选,其中清华大学 3 人,北京大学和中国人民大学各 2 人,香港...
阅读更多电离层抑制成测绘RTK终端核心标配,千寻位置充分发挥北斗应用能力
业界日益加剧的电离层扰动对高精度定位的影响愈发严重。7月27日起,千寻位置率先升级北斗高精度定位终端,将电离层抑制能力陆续推送覆盖全部在售及已售出的云端一体及星地一体系列北斗高精度RTK终端设备,引领电离层抑制能力成测绘RTK终端核心标配,实现行业型北斗底层技术能...
阅读更多弥平仿真与现实的鸿沟:李飞飞、吴佳俊团队发布用于 Sim2Real 迁移的多感官物体数据集
人工智能李飞飞、吴佳俊等人发布多感官物体数据集 OBJECTFOLDER 2.0。是否准备好从 ImageNet 时代走向 OBJECTFOLDER 时代?编译|OGAI编辑|陈彩娴近年来,以物体为中心的多传感器学习显示出了巨大的潜力。然而,以往的物体建模工作与现实...
阅读更多马斯克收购推特之谜:他还能从哪里获得210亿美元?
业界据外媒报道,美东时间4月25日,Elon Musk和Twitter Inc.达成协议,马斯克计划以 440 亿美元收购社交网络平台Twitter。不过在马斯克方面,目前仍然存在一个问题待解:他将如何支付交易中,他个人担保的210 亿美元的部分股权?现年5...
阅读更多骁龙顶级移动技术加持,黑鲨5系列打造端到端突破性游戏体验
业界3月30日,广大移动游戏玩家期待已久的黑鲨5系列游戏手机正式发布,全新黑鲨5系列包括黑鲨5、黑鲨5 Pro和黑鲨5 RS三款产品。其中,黑鲨5 Pro搭载领先的顶级移动平台全新一代骁龙8移动平台,实现了在性能、游戏、影音娱乐、连接等领域的全面顶级体验。作为...
阅读更多