共收录 7 个相关网站
www.droitstock.com
卓特视觉是国内专业版权素材与AI创意服务平台,汇集超3亿张正版图片、视频素材,提供商用素材授权、AI图片生成、AI训练数据服务,支持企业数字资产管理与Adobe官方采购,可帮创作者、企业规避版权风险,完成全流程内容生产。
trexlabel.com
开箱即用的专业智能标注工具,专注解决密集场景标注难题,面向AI算法训练数据标注需求,通过技术优化提升密集类数据标注的整体效率,保障标注结果准确性,降低标注团队与个人的时间成本,适配算法研发场景的标注需求。
anycrawl.dev
专为现代AI应用打造的高性能网页爬取与数据抓取工具,聚焦解决网络非结构化内容转化为标准化结构化数据的核心痛点,支持开发者、AI训练团队快速获取公开网页信息,适配多场景数据采集需求,工具性能稳定适配各类爬取场景。
commoncrawl.org
全球最大开放网页爬取项目,每月爬取数十亿公开网页并免费提供完整存档,数据以WARC/WAT/WET格式存储,是GPT、LLaMA等主流大语言模型核心训练数据来源,也是NLP领域研究、互联网舆情分析等方向的重要开放基础数据设施。
hub.baai.ac.cn
智源研究院主导建设的CCI中文互联网语料库,是中文领域极具影响力的开源语料库,最新版本CCI 4.0数据总量达35TB,包含中英双语数据集与425B token的CoT推理合成数据,累计支持了全国500余家企事业单位开展大模型研发工作,能够为AI领域从业者提供高质量的训练数据支撑。
www.selectdataset.com
遇见数据集是专业的数据集搜索引擎平台,专注追踪汇总全球公开数据集资源,为数据开发者、科研人员、学生等不同群体提供便捷高效的数据资源检索入口,帮助用户快速定位所需数据资源,助力数据领域从业者高效把握数据要素市场,推动数据研究与开发项目落地。
storage.googleapis.com
谷歌发布的超大型公开图像数据集,目前计算机视觉领域进行大规模预训练和复杂场景分析的顶级数据源,拥有数百万张标注图片与千万级精准边界框,涵盖细粒度层级标签与物体视觉关系,服务全球计算机视觉研发团队与学习者的权威数据源。