据 The Decoder 报道,艾伦人工智能研究所(Allen Institute for AI,简称 AI2)发布包含各种网络内容、科学出版物、代码和书籍的三万亿个 token 的开源数据集 Dolma,是迄今为止最大的公开数据集。Dolma 是开放语言模型 (OLMo) 的基础。OLMo 是 AI2 目前正在开发的语言模型,计划于 2024 年初发布,目标是成为“最佳开放语言模型”。Dolma 的第一个版本主要限于英文文本,开发人员和研究人员现可以通过 Hugging Face 访问该数据集。 原文链接 —- 编译者/作者:Yangz 玩币族申明:玩币族作为开放的资讯翻译/分享平台,所提供的所有资讯仅代表作者个人观点,与玩币族平台立场无关,且不构成任何投资理财建议。文章版权归原作者所有。 |
人工智能研究所 AI2 发布最大的 LLM 开源数据集 Dolma,包含 3 万亿 Tokens
2023-08-23 Yangz 来源:区块链网络
LOADING...
相关阅读:
- 德国计划在未来两年内将人工智能资金增加一倍,达到近 10 亿欧元2023-08-23
- RISC-V 中国峰会召开,阿里平头哥推出首个 RISC-V AI 平台2023-08-23
- 青岛获批建设国家“算力平台”,聚焦海洋领域人工智能发展2023-08-23
- IBM 利用 AI 将 COBOL 相应代码转译成 Java 语言2023-08-23
- 生物医药基础大模型研发商“水木分子”完成千万级种子轮融资2023-08-23