共收录 1 个相关网站
commoncrawl.org
全球最大开放网页爬取项目,每月爬取数十亿公开网页并免费提供完整存档,数据以WARC/WAT/WET格式存储,是GPT、LLaMA等主流大语言模型核心训练数据来源,也是NLP领域研究、互联网舆情分析等方向的重要开放基础数据设施。