共收录 2 个相关网站
arcinstitute.org
由Arc Institute推出的超大规模开放单细胞数据集,收录超六亿细胞观测与药物扰动信息,以CC0协议完全开放获取,面向计算生物学领域研究者与AI药物研发团队,为AI虚拟细胞建模、创新药物发现提供权威且高质量的核心基础数据支撑
commoncrawl.org
全球最大开放网页爬取项目,每月爬取数十亿公开网页并免费提供完整存档,数据以WARC/WAT/WET格式存储,是GPT、LLaMA等主流大语言模型核心训练数据来源,也是NLP领域研究、互联网舆情分析等方向的重要开放基础数据设施。