计算机视觉

共收录 38 个相关网站

8 个分类
20 个关联标签
38 个结果
O
Open Images数据集官网storage.googleapis.com
O
Open Images数据集官网storage.googleapis.com
O

Open Images数据集官网

storage.googleapis.com

谷歌发布的超大型公开图像数据集,目前计算机视觉领域进行大规模预训练和复杂场景分析的顶级数据源,拥有数百万张标注图片与千万级精准边界框,涵盖细粒度层级标签与物体视觉关系,服务全球计算机视觉研发团队与学习者的权威数据源。

免费
T
Tarsiergithub.com
T
Tarsiergithub.com
T

Tarsier

github.com

Tarsier是字节跳动研发的开源视频语言AI模型,具备高质量视频内容描述与理解能力,可适配多种不同类型的视频理解任务,为相关领域研发提供可靠支撑,开发者可以通过GitHub获取完整项目源码、开发文档与更新记录,助力视频AI领域的技术落地与创新探索。

免费
W
Wav2Lipgithub.com
W
Wav2Lipgithub.com
W

Wav2Lip

github.com

Wav2Lip是一款专注于唇音同步的开源深度学习项目,可实现任意音频与目标人脸视频的唇部动作高精度对齐,支持多语言、多种人脸场景,能生成自然逼真的唇同步效果,广泛应用于影视配音本地化、虚拟数字人交互等场景,技术基于GAN与时序卷积网络结合实现。

免费
P
PaddleOCRgithub.com
P
PaddleOCRgithub.com
P

PaddleOCR

github.com

由飞桨团队推出的开源光学字符识别工具库,面向开发者提供丰富领先的实用OCR工具,支持超80种语言识别、全流程模型训练与多平台部署,覆盖多类特殊识别场景,可快速实现OCR技术应用落地,是国内知名度极高的OCR开发工具。

免费
E
EasyOCRgithub.com
E
EasyOCRgithub.com
E

EasyOCR

github.com

由JaidedAI开发的开源深度学习光学字符识别工具,支持八十余种语言文本提取,覆盖文档数字化、车牌识别、票据处理等多场景,自带预训练模型开箱即用,支持GPU加速,适配多种输入格式,满足普通用户与开发者的OCR识别需求。

免费
有
有道智云AI开放平台ai.youdao.com
有
有道智云AI开放平台ai.youdao.com
有

有道智云AI开放平台

ai.youdao.com

网易有道推出的AI开放平台,域名为ai.youdao.com,面向政务、企业与开发者提供多品类稳定AI基础能力,覆盖自然语言处理、计算机视觉等多技术方向,支持按需调用,助力各类机构降低AI开发门槛,快速实现智能化升级。

免费
T
T-Rex Labeltrexlabel.com
T
T-Rex Labeltrexlabel.com
T

T-Rex Label

trexlabel.com

开箱即用的专业智能标注工具,专注解决密集场景标注难题,面向AI算法训练数据标注需求,通过技术优化提升密集类数据标注的整体效率,保障标注结果准确性,降低标注团队与个人的时间成本,适配算法研发场景的标注需求。

免费
换
换脸科技-AI人脸引擎huanlian.com
换
换脸科技-AI人脸引擎huanlian.com
换

换脸科技-AI人脸引擎

huanlian.com

换脸科技-AI人脸引擎是专注于AI人脸技术领域的专业导航收录站点,聚合了各类合规的AI人脸应用工具、技术开发资源与行业资讯内容,为相关从业者与爱好者提供清晰有序的一站式资源导航服务,帮助用户快速定位匹配自身需求的人脸技术相关资源,提升信息获取与工具使用效率。

免费
D
DDColorgithub.com
D
DDColorgithub.com
D

DDColor

github.com

阿里巴巴达摩院研发的基于深度学习技术的专业图像上色工具,采用双解码器架构同时处理色彩分布与像素级细节,支持历史黑白照片、动漫游戏场景、自然风景图像上色,可输出高度真实自然的着色效果,开放项目源码与在线演示通道。平台界面简洁直观,操作流程清晰,新用户无需学习成本即可快速上手。

免费
D
Diffutoonecnu-cilab.github.io
D
Diffutoonecnu-cilab.github.io
D

Diffutoon

ecnu-cilab.github.io

Diffutoon是基于扩散模型的高分辨率可编辑卡通着色技术官方项目站点,展示了核心技术框架与功能特性,支持将真实视频转换为动漫风格,同时保障内容一致性与输出质量,为动画创作者、AI技术研究者提供前沿技术参考与应用探索方向。

免费
U
Unique3Dwukailu.github.io
U
Unique3Dwukailu.github.io
U

Unique3D

wukailu.github.io

由清华大学与AVAR Inc.研究团队联合开发的图像转3D网格生成工具,可在三十秒内从单张二维图像生成高质量三维网格模型,面向3D创作、设计从业者与科研人员开放,属于开源技术类工具导航,简化3D建模流程,降低普通用户生成3D模型的技术门槛。

免费
B
BuboGPTbubo-gpt.github.io
B
BuboGPTbubo-gpt.github.io
B

BuboGPT

bubo-gpt.github.io

字节跳动推出的多模态大语言模型,支持文本、图像、音频多模态输入处理,同时具备对齐与非对齐内容理解能力,面向AI开发者、研究者与普通用户开放能力调用参考,可帮助用户完成多模态场景下的智能交互、信息处理与开发适配测试。

免费
D
DreamTalkdreamtalk-project.github.io
D
DreamTalkdreamtalk-project.github.io
D

DreamTalk

dreamtalk-project.github.io

基于扩散模型的音频驱动表达性头部生成开源框架,可将静态人物照片结合音频输入,生成人物自然说话、表情同步匹配的逼真视频,支持自定义图像与音频素材,助力开发者快速实现数字人相关功能开发与技术验证,适合AI数字内容生成方向研究学习。

免费
D
DragGANvcai.mpi-inf.mpg.de
D
DragGANvcai.mpi-inf.mpg.de
D

DragGAN

vcai.mpi-inf.mpg.de

DragGAN是一款基于生成对抗网络技术的专业AI图像编辑工具,支持用户通过拖拽图片内任意锚点,精准调整图像的形状、姿势、表情、布局与位置等维度,为专业图像创作、设计修改提供了灵活可控的新型编辑方案,降低精准局部调整的操作门槛。

免费
X
xslistst.so.com
X
xslistst.so.com
X

xslist

st.so.com

xslist是依托AI技术打造的专业人脸识别工具导航站点,聚合各类合规人脸识别应用与技术服务资源,为用户梳理正规可信的人脸识别工具入口,覆盖身份核验、图像人脸检测等多场景需求,帮助用户快速定位匹配自身需求的合规人脸识别服务。

免费
T
TokenFlowdiffusion-tokenflow.github.io
T
TokenFlowdiffusion-tokenflow.github.io
T

TokenFlow

diffusion-tokenflow.github.io

TokenFlow是依托预训练文本到图像扩散模型打造的创新视频编辑框架,依托扩散模型固有特性,能够输出一致性强、质量出众的视频编辑成果,为创意视频创作领域提供了全新的技术路径,吸引AI创作从业者与爱好者尝试探索。

免费
I
IDM-VTONidm-vton.github.io
I
IDM-VTONidm-vton.github.io
I

IDM-VTON

idm-vton.github.io

IDM-VTON是一款基于深度学习与扩散模型开发的AI虚拟试穿技术工具,主打高保真度图像生成,可输出效果逼真的虚拟试穿成品,为服装电商、设计开发与个人穿搭场景提供了高效的AI试衣换衣技术支持,降低实体试衣成本。

免费
C
Caffecaffe.berkeleyvision.org
C
Caffecaffe.berkeleyvision.org
C

Caffe

caffe.berkeleyvision.org

伯克利视觉与学习中心推出的开源深度学习框架,专为卷积神经网络设计开发,支持多种图像分类与目标检测任务,拥有清晰的架构配置体系,无需编写代码即可完成模型训练部署,适配CPU与GPU多种计算环境,是计算机视觉领域开发者入门与生产的经典工具

免费
百
百度AI开放平台ai.baidu.com
百
百度AI开放平台ai.baidu.com
百

百度AI开放平台

ai.baidu.com

百度官方推出的综合性人工智能技术服务平台,面向开发者、企业提供涵盖语音、文字图像、计算机视觉、自然语言处理、知识图谱等多领域的成熟AI能力与开发工具,支持快速调用、二次开发,助力不同行业高效落地AI应用项目

免费
M
Moondreammoondream.ai
M
Moondreammoondream.ai
M

Moondream

moondream.ai

Moondream是开发者vikhyatk推出的开源轻量级视觉语言模型,主打高效灵活的图像理解与文本生成能力,面向AI开发从业者、AI学习者开放源代码,支持自定义二次开发适配多类细分视觉交互场景,降低小体量视觉AI项目的开发门槛。

免费
O
OmniHumanomnihuman-lab.github.io
O
OmniHumanomnihuman-lab.github.io
O

OmniHuman

omnihuman-lab.github.io

字节跳动研发的多模态条件驱动人体视频生成框架,可同时接受文本、图像、音频、姿态等多种输入条件,支持从单张静态照片生成完整全身动态数字人视频,为AI数字内容创作、数字人研发提供专业技术支撑,降低人体视频生成技术门槛。

免费
动
动手学深度学习zh.d2l.ai
动
动手学深度学习zh.d2l.ai
动

动手学深度学习

zh.d2l.ai

面向中文深度学习学习者打造的免费开源交互式在线教科书平台,同步提供PyTorch、MXNet、TensorFlow、PaddlePaddle多框架代码实现,可直接在线运行代码调试,支持全球学习者开放交流,已被数百所高校选作教学用书,适配入门到进阶不同学习阶段。

免费
皮
皮卡智能www.picup.ai
皮
皮卡智能www.picup.ai
皮

皮卡智能

www.picup.ai

人工智能驱动的创意计算机视觉平台,依托成熟AI技术深耕计算机视觉领域,面向全场景客户提供适配商业设计、创意设计的全流程工作流解决方案,助力各类设计、电商从业者降低技术门槛,提升创意产出效率,简化传统设计工作流程,加速创意落地,适配多领域商业视觉需求。

免费
虹
虹软www.arcsoft.com.cn
虹
虹软www.arcsoft.com.cn
虹

虹软

www.arcsoft.com.cn

虹软是全球领先的视觉人工智能技术公司,专注计算机视觉算法研发,为智能手机、智能汽车、智能家居、智能零售、互联网视频等多个领域提供专业算法服务与落地方案,推动视觉AI技术商业化落地,赋能全行业智能化升级。

免费