当前位置:首页 > 科技  > 资讯

40亿数据灌注国内首个古籍处理与研究开源智能工具

来源: 责编: 时间:2024-01-08 09:14:11 311观看
导读  “秦淮佳丽地,城阙望中迷。柳暗青丝发,花香碧玉衣。歌楼留夜色,画阁敛春晖。细雨轻舟去,双鱼梦泽飞。”这是近日上线的“荀子”古籍大语言模型(以下简称“荀子”)以“金陵”为题,生成的一首古诗。  记者了解到,“荀子”

  “秦淮佳丽地,城阙望中迷。柳暗青丝发,花香碧玉衣。歌楼留夜色,画阁敛春晖。细雨轻舟去,双鱼梦泽飞。”这是近日上线的“荀子”古籍大语言模型(以下简称“荀子”)以“金陵”为题,生成的一首古诗。8id28资讯网——每日最新资讯28at.com

  记者了解到,“荀子”是国内首个专门应用于古籍处理与研究的开源智能工具,由南京农业大学王东波教授研究团队联合古联(北京)数字传媒科技有限公司发布。它依托国家社科基金重大项目“中国古代典籍跨语言知识库构建及应用研究”,基于40亿字的大型混合语料数据生成。8id28资讯网——每日最新资讯28at.com

  “数据是大模型的基础。”王东波介绍,在“荀子”的研发过程中,研究团队在人工智能通用模型的基础上,灌注了繁简体《四库全书》等20亿字的古代汉语语料和文化领域的20亿字的现代汉语语料,使“荀子”具有古籍智能标引、古籍信息抽取、诗歌生成、古籍高质量翻译、阅读理解等功能。8id28资讯网——每日最新资讯28at.com

  “对于汉语言研究者来说,他们还可以利用‘荀子’完成古籍词法分析、实体识别、关系抽取、文本分类与匹配、文本摘要等工作。”王东波举例,如果要研究《史记·陈涉世家》的人物关系,就可以用“荀子”识别这篇文章中的人物名称和关系名词,再用知识图谱的方式呈现人物关系图谱,从而提高检索、查询、研究的效率。8id28资讯网——每日最新资讯28at.com

  王东波介绍,此次发布的“荀子”大模型中的基座模型,还可以让用户根据自己的需求对“荀子”进行微调,帮助用户开展更有针对性的研究。8id28资讯网——每日最新资讯28at.com

  “荀子”是怎么做到化繁为简、通读古今的?“核心是‘算力充足’并且‘饱读诗书’。”王东波介绍,“荀子”的顺利问世离不开南京农业大学提供的高性能算力基础设施支持,以及研究团队长期积累的精加工语料库。8id28资讯网——每日最新资讯28at.com

  “模型的构建受算力、场景应用等多方影响,但精准度较高的优质数据是最为关键的。”王东波表示,研究团队自2013年起,一直专注于人工精标注数据的工作。8id28资讯网——每日最新资讯28at.com

  “比如要训练大模型自动标注《岳阳楼记》中的形容词,首先需要人工标注这篇文章中的形容词。在积累了大量的人工标注后,再让机器进行学习。”王东波说,这项“坐冷板凳”的基础标注工作,他们一做就是10年。8id28资讯网——每日最新资讯28at.com

  “我们期待能将古籍的智能化研究与跨学科的人才培养相结合,让学生既有前瞻的科研视野,又能积累较为深厚的人文底蕴。”王东波表示,研究团队希望能让更多人接触古籍、品读古籍、传播古籍,让“故纸堆”重新焕发活力,推动中华优秀传统文化创造性转化、创新性发展,赓续中华文脉。8id28资讯网——每日最新资讯28at.com

  王东波介绍,“荀子”除了能让人们更顺畅地阅读古籍内容,推动古籍整理、古籍数字化、古籍活化利用与传播之外,未来还可应用于人工智能写作、人工智能教学、数字文娱等领域。(记者 金凤)8id28资讯网——每日最新资讯28at.com

本文链接:http://www.28at.com/showinfo-16-57730-0.html40亿数据灌注国内首个古籍处理与研究开源智能工具

声明:本网页内容旨在传播知识,若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。邮件:2376512515@qq.com

上一篇: 17部门联合部署“数据要素×”三年行动计划

下一篇: 领军企业推动数字技术快速发展

标签:
  • 热门焦点
  • 十个可以手动编写的 JavaScript 数组 API

    JavaScript 中有很多API,使用得当,会很方便,省力不少。 你知道它的原理吗? 今天这篇文章,我们将对它们进行一次小总结。现在开始吧。1.forEach()forEach()用于遍历数组接收一参
  • Rust中的高吞吐量流处理

    作者 | Noz编译 | 王瑞平本篇文章主要介绍了Rust中流处理的概念、方法和优化。作者不仅介绍了流处理的基本概念以及Rust中常用的流处理库,还使用这些库实现了一个流处理程序
  • 一文看懂为苹果Vision Pro开发应用程序

    译者 | 布加迪审校 | 重楼苹果的Vision Pro是一款混合现实(MR)头戴设备。Vision Pro结合了虚拟现实(VR)和增强现实(AR)的沉浸感。其高分辨率显示屏、先进的传感器和强大的处理能力
  • 分布式系统中的CAP理论,面试必问,你理解了嘛?

    对于刚刚接触分布式系统的小伙伴们来说,一提起分布式系统,就感觉高大上,深不可测。而且看了很多书和视频还是一脸懵逼。这篇文章主要使用大白话的方式,带你理解一下分布式系统
  • 如何正确使用:Has和:Nth-Last-Child

    我们可以用CSS检查,以了解一组元素的数量是否小于或等于一个数字。例如,一个拥有三个或更多子项的grid。你可能会想,为什么需要这样做呢?在某些情况下,一个组件或一个布局可能会
  • 得物效率前端微应用推进过程与思考

    一、背景效率工程随着业务的发展,组织规模的扩大,越来越多的企业开始意识到协作效率对于企业团队的重要性,甚至是决定其在某个行业竞争中突围的关键,是企业长久生存的根本。得物
  • 学习JavaScript的10个理由...

    作者 | Simplilearn编译 | 王瑞平当你决心学习一门语言的时候,很难选择到底应该学习哪一门,常用的语言有Python、Java、JavaScript、C/CPP、PHP、Swift、C#、Ruby、Objective-
  • 阿里瓴羊One推出背后,零售企业迎数字化新解

    作者:刘旷近年来随着数字经济的高速发展,各式各样的SaaS应用服务更是层出不穷,但本质上SaaS大多局限于单一业务流层面,对用户核心关切的增长问题等则没有提供更好的解法。在Saa
  • iQOO Neo8系列或定档5月23日:首发天玑9200+ 安卓跑分王者

    去年10月,iQOO推出了iQOO Neo7系列机型,不仅搭载了天玑9000+,而且是同价位唯一一款天玑9000+直屏旗舰,一经上市便受到了用户的广泛关注。在时隔半年后,
Top