AI开源项目(第 2 页)
「AI开源项目」分类下共收录 89 款工具,常用的有 MiracleVision奇想智能、Depth Anything、ReplaceAnything 等,点击卡片即可直达官网。
全部6,827
学术集634
生产力工具226
AI通用写作206
电商圈198
生活助手183
图片生成176
AI社交媒体助理163
AI文案写作152
教育助理147
创业工具141
AI文章摘录130
设计助手128
图片编辑126
AI搜索引擎优化118
海外被墙116
AI邮件助理110
低代码 / 无代码108
AI音乐生成105
AI写作工具103
艺术创作100
AI视频生成96
AI提示词93
销售工具93
客户服务92
AI开源项目89
AI代码88
AI绘画工具78
虚拟形象78
全部分类 245
TextDiffuser-2
一个功能强大的图像生成工具,它通过扩散模型技术,根据文本描述生成高质量的图像。这个工具为用户提供了一种创新的方式来探索和实现他们的创意视觉概念。
EMO
用音频驱动人像视频生成,让人物跟着声音做表情和头部动作
UniEdit
UniEdit 是一个强大的视频编辑工具,它通过利用预训练的文本到视频生成器,在无需调优的情况下,提供了一种简单而有效的方法来编辑视频的运动和外观。
OmniGen
一个统一的图像生成模型,能文生图,也能改图、按主题生成图片。
Loopy
一个创新的音频驱动的肖像头像生成模型,通过长期运动依赖和音频到潜在空间的映射,实现了仅通过音频输入生成逼真、自然的肖像头像视频
eSearch
一款综合性的屏幕识别和搜索工具,它通过集成多种实用功能,为用户提供了一个便捷的工作流程,从截图到文本识别,再到信息搜索和翻译,eSearch都能够提供高效的解决方案
HivisionIDPhotos
HivisionIDPhotos是一个功能全面、操作简便的AI证件照制作工具。它不仅能够满足用户对证件照的基本制作需求,还提供了人像抠图、底色添加、排版照生成等高级功能
SUPIR
一款功能强大且多用途的图像恢复工具,它通过结合AI技术和文本驱动的智能恢复,能够为用户提供高保真度的图像恢复服务
SeedEdit
一款功能强大且创新的图像编辑工具,它通过先进的扩散模型技术,实现了对图像的高精度和高审美的编辑
WiseFlow
WiseFlow作为一个开源的AI信息挖掘工具,通过其强大的自动抓取、分类整理和智能处理功能,为用户提供了高效的信息管理解决方案
MinerU
从PDF里提取内容的开源工具,能识别公式、去掉干扰元素、保留排版格式。
Tailor
一款集视频剪辑、生成和优化功能于一身的智能视频处理工具,凭借其简单易用的操作方式、强大的功能和智能高效的处理能力
F5-TTS
一款功能强大、性能卓越的文本到语音转换工具,通过先进的深度学习技术和创新的架构设计,实现了高质量的语音合成
OmniParser
一个创新的屏幕解析工具,它通过与先进的视觉语言模型结合,显著提升了智能代理在用户界面中的操作能力
Roop
一个功能强大的换脸工具,以其简单易用和高性能的特点,为用户提供了一种便捷的方式来实现视频中的面孔替换
MaskGCT
一个功能强大的语音合成大模型,它不仅在技术上达到了行业领先水平,还在多语言支持、声音克隆和语音控制等方面表现出色
EchoMimic
一款创新的音频驱动肖像动画生成工具,它通过结合音频和面部地标信息,能够生成逼真、自然的肖像动画
STranslate
一款实用的翻译和OCR工具,以其即用即走的特点、开源免费的优势以及社区支持的便利性,为用户提供了高效、便捷的文本处理解决方案
VideoDoodles
一个极具创意和实用性的工具,它将手绘艺术与视频编辑相结合,为视频创作者提供了一种全新的表达方式
Unique3D
个创新的单图像 3D 网格生成工具,以其高保真度、高效训练和优化以及强泛化能力脱颖而出
GameNGen
由谷歌推出的世界首个完全由AI驱动的游戏引擎,旨在颠覆传统的游戏开发方式。这个引擎利用神经网络实时生成游戏画面,无需手动编写代码
RMBG-2.0
由BRIA AI推出的一款下一代图像背景移除模型,它基于创新的BiRefNet架构,能够在复杂环境中提供高精度的背景移除结果
DeepTranslate
一款功能强大、使用便捷的免费AI双语页面翻译浏览器插件。它支持多种语言和翻译API,能够满足用户在不同场景下的翻译需求
EasyAnimate
基于Transformer架构的视频生成工具,提供了高效、灵活的视频生成解决方案
FunAudioLLM
由阿里巴巴集团通义语音团队开发的框架,旨在增强人类与大型语言模型(LLMs)之间的自然语音交互
Clapper
一个创新的AI视频创作工具,它通过提供一个交互式和直观的创作平台,降低了视频制作的门槛
OpenVoice
一个强大的即时语音克隆工具,具有精确的音色克隆、灵活的风格控制和零样本跨语言克隆等优势
DreaMoving
一个强大的视频生成框架,通过其创新的Video ControlNet和Content Guider,实现了对视频内容的高度控制
AtomoVideo
一个创新的图像到视频生成框架,它通过先进的技术和灵活的架构,为用户提供了一种从静态图像生成高保真视频的新方法
Fluid
一个创新的文本到图像生成模型,通过使用连续标记和随机生成顺序,显著提高了图像生成的质量和性能
Swarm
Swarm是一个由OpenAI解决方案团队管理的教育框架,旨在探索轻量级、易于使用的多智能体编排技术。
JoyHallo
一个功能强大的数字人模型,专注于普通话和英语的音频驱动视频生成。它通过优化模型结构和数据集支持,实现了高效的跨语言生成能力,并在推理速度和准确性上表现出色
Mochi 1
它通过高质量的视频生成、强大的文本提示一致性和先进的技术架构,为用户提供了强大的视频生成能力
Seaweed APT
一个具有突破性的AI工具,通过单步生成技术大幅提升了视频和图像生成的效率,同时保持了高质量的生成效果
需梯子
cogvlm2-llama3-caption
强大的视频描述生成工具,通过先进的多模态处理和上下文感知能力,为用户提供了一种快速理解视频内容的方法。它的实时处理能力和定制化描述功能,使其在多种应用场景中都非常有用。
需梯子
AnyText
在图像里生成或修改指定文字,支持多语言,可自己画位置或指定文字摆放区域。
需梯子
FineVideo
Hugging Face上的多模态视频数据集,给AI模型提供理解视频内容用的素材。
需梯子
MMMLU
重要的多语言、多任务语言理解数据集,它为研究人员和开发者提供了一个标准化的测试基准,用于评估和提升AI模型在不同语言和文化背景下的性能。
需梯子
StarCoder 2
一个强大的代码生成和理解工具,它通过大规模训练和多样化的模型规模,为开发者提供了一个高性能的编程辅助平台。
需梯子
Seed-VC
一个创新的声音转换工具,它通过零样本学习技术,能够在不需要特定目标音色样本的情况下实现高质量的声音转换
需梯子
NotebookLlama
Meta推出的将PDF文档转换成播客内容的开源项目。项目基于一系列自动化步骤实现,用LLaMa模型进行PDF预处理、生成播客脚本、增加戏剧化元素及文本转语音合成