开放爬取项目

共收录 1 个相关网站

1 个分类
11 个关联标签
1 个结果
C
Common Crawlcommoncrawl.org
C
Common Crawlcommoncrawl.org
C

Common Crawl

commoncrawl.org

全球最大开放网页爬取项目,每月爬取数十亿公开网页并免费提供完整存档,数据以WARC/WAT/WET格式存储,是GPT、LLaMA等主流大语言模型核心训练数据来源,也是NLP领域研究、互联网舆情分析等方向的重要开放基础数据设施。

免费