全部7,845
学术集634
生产力工具225
AI通用写作206
电商圈188
生活助手178
图片生成176
AI社交媒体助理161
AI文案写作152
新收录AI工具151
教育助理147
创业工具141
AI文章摘录130
设计助手127
图片编辑124
趣味工具120
AI搜索引擎优化117
AI邮件助理110
低代码 / 无代码108
艺术创作99
AI写作工具96
销售工具93
AI提示词91
客户服务91
AI开源项目89
AI视频生成85
AI代码81
虚拟形象78
搜索工具78
全部分类 334
AI开源项目(89 款)
MiracleVision奇想智能
一款懂美学的AI视觉大模型
Depth Anything
Depth Anything是由香港大学、TikTok和浙江实验室联合开发的单目深度估计模型。该模型特别擅长利用大规模无标注图像进行深度估计,具有出色的性能和实用性。
ReplaceAnything
Replace Anything 是由阿里巴巴开发的一款 AI 图像内容替换框架,主要用于图像编辑和生成领域。其核心目标是在不改变用户指定对象身份的前提下,生成新的内容。
Animate Anyone
一个功能强大且易于使用的图像到视频角色动画合成框架。它通过实时动画合成技术和用户友好的界面,使得动画制作变得更加简单和快捷。
CogVideoX-Fun
基于 CogVideoX 结合 EasyAnimate 修改的 AI 视频生成工具,它提供更自由的生成条件,支持从文字、图片到视频的多模态内容生成。
Outfit Anyone
AI服装虚拟试穿工具,让用户和模特在线试穿并展示服装
StoryMaker
通过先进的 AI 技术,为创作者提供了一种生成具有高度一致性和个性化特征的图像序列的方法,特别适合需要角色和场景连贯性的创意项目
I2VGen-XL:阿里推出的图生视频模型
阿里推出的图生视频模型,把静态图片转成连贯动态视频
PhotoMaker V2
AI图像生成工具,用深度学习快速生成逼真的人物图像
书生·物华2.0(3DTopia 2.0)
采用创新的原语(primitive-based)三维表示方法PrimX,能够高效编码和生成具有物理基础渲染(PBR)特性的高质量三维资产。
FaceChain
结合Stable Diffusion与LoRA,生成个性化数字形象和写真
MagicVideo-V2
一个创新的AI视频生成框架,它通过集成多个模块来生成高质量的视频内容。它不仅提高了视频生成的效率和质量,还确保了视频画面的流畅和逼真,为用户提供了极佳的观看体验。
Motionshop
一个创新的AI角色动画框架,通过将视频中的人物替换为3D化身,实现了现实与虚拟的无缝融合。它利用多种先进技术,提供高质量的动画效果,极大地丰富了视频内容的表现形式。
DDColor
用户可以轻松上传黑白图片,快速获得彩色结果,无论是对于修复老照片还是为动漫风景上色,DDColor都能提供令人满意的效果。
cogvlm2-llama3-caption
强大的视频描述生成工具,通过先进的多模态处理和上下文感知能力,为用户提供了一种快速理解视频内容的方法。它的实时处理能力和定制化描述功能,使其在多种应用场景中都非常有用。
AnyText
在图像里生成或修改指定文字,支持多语言,可自己画位置或指定文字摆放区域。
Real-ESRGAN
一个强大的图像超分辨率工具,它利用深度学习和生成对抗网络,在没有真实高分辨率图像作为参考的情况下,通过合成退化过程来提升低分辨率图像的质量。
Screenshot to Code
无论是在线使用还是本地部署,它都为用户提供了灵活、高效的代码生成解决方案。此外,通过提供编辑功能和代码导出,它满足了用户对代码调整和个性化的需求。
Gummy
通义实验室官网,汇集通义千问等大模型,能理解文字、图片和音频并生成内容。
Ovis1.6
强大的多模态大模型,它通过创新的架构设计和全面的数据优化,在多模态任务上展现了卓越的性能。
ActAnywhere
一个强大的视频生成工具,它通过自动化的前景与背景融合技术,极大地简化了视频背景生成的过程。它的应用场景广泛,从电影制作到教育,都能提供高效、创新的解决方案。
DemoFusion
把低分辨率图像变高清的生成框架,不用额外训练也不怎么吃显存。
Vary-toy
一个小型但功能强大的视觉语言模型,它使得资源有限的研究者和开发者也能体验到先进的视觉语言模型功能。
Draw an Audio
创新的视频生成音频系统,它通过先进的AI技术,能够自动分析视频内容并生成与之匹配的声音效果。
Void
它通过集成AI功能,为用户提供了一个高效、智能的编程和文本编辑环境。无论是代码开发还是文本编辑,Void都能提供强大的支持和便捷的操作。
FineVideo
Hugging Face上的多模态视频数据集,给AI模型提供理解视频内容用的素材。
abab-music-1
一个强大的AI音乐生成工具,它通过先进的技术,使得音乐创作更加便捷和高效。无论是专业的音乐制作人还是业余爱好者,都能够利用这个模型来创作出高质量的音乐作品。
OLMo
一个开放的语言模型框架,它为研究人员和开发者提供了一套完整的工具和资源,以促进AI和语言模型的共同进步。
Follow Your Pose
按文本描述生成视频,还能用姿态序列控制视频里角色的具体动作。
Lepton Search
开源的对话式AI搜索引擎,把大语言模型和搜索结合,可自建搜索应用。
Llama 3.2
在图像理解和文本处理任务上展现出卓越的性能,并通过定制化微调和本地部署,推动了AI技术的开放性和可访问性。
IP-Adapter
给文生图扩散模型加图像提示,轻量易部署,可用于生成、转换和修复图像。
PDF2Audio
通过将PDF文档转换成音频内容,为用户提供了一种新的信息消费方式。无论是教育、播客制作还是无障碍访问,PDF2Audio都能满足多样化的需求。
MetaGPT
多智能体编程框架,模拟人类工作流程来生成和优化代码。
MMMLU
重要的多语言、多任务语言理解数据集,它为研究人员和开发者提供了一个标准化的测试基准,用于评估和提升AI模型在不同语言和文化背景下的性能。
SafeEar
创新的音频伪造检测工具,它通过先进的AI技术保护用户的语音隐私,同时提供高效的伪造音频检测能力。
Make-A-Character
用文字描述快速生成逼真3D角色的框架。
MotionCtrl
强大的视频生成工具,它通过精确控制视频中的相机和物体运动,为视频制作带来了新的可能性。无论是简单的运动场景还是复杂的交互动作,MotionCtrl都能够提供令人满意的解决方案。
MIMO
创新的AI框架,它通过空间分解建模技术,提供了一种先进的可控角色视频合成方法。
PortraitGen
AI人像视频编辑工具,能高质量编辑视频里的人物。
GOT-OCR2.0
创新的OCR模型,它通过先进的技术提供了精准、高效的OCR解决方案。无论是文档数字化、场景文本识别还是票据处理等应用场景,GOT-OCR 2.0都能提供强大的支持。
AnimateDiff
通过预训练的运动建模模块,使得用户能够轻松地创作出丰富多样的动画内容,同时保持了原有模型的风格和特性。它的跨领域应用性和易于集成的特点,极大地扩展了个性化动画的创作空间。
V-JEPA
创新的自监督学习模型,它通过预测视频帧的特征表示来学习视频的视觉表示。这种方法不仅能够处理视频内容,还能在图像任务上表现出色,具有广泛的应用潜力。
onewebot2
易于使用的微信AI机器人软件包,它通过简化的配置流程和一键运行功能,使得用户能够快速启动和运行微信机器人。无论是个人还是企业,都能通过oneWebot2创建智能助手,实现自动化服务
Boximator
强大的视频合成工具,它通过创新的框约束机制和自跟踪技术,实现了对视频中对象运动的精细控制。这使得它在电影制作、游戏开发、VR/AR内容创作等领域具有广泛的应用潜力。
DiT
创新的图像生成模型,它通过结合扩散模型和Transformer架构,实现了在图像生成任务中的高效和高质量输出。其可扩展性和条件生成能力使其在多个领域都有广泛的应用潜力。
VideoPoet
强大的AI视频生成工具,它通过大型语言模型架构和多模态输入处理能力,实现了从文本到视频的转换、图像动画生成、视频风格化、视频编辑和音频生成等多种功能。
ScreenAgent
一个先进的计算机控制智能体,它通过观察屏幕截图和执行鼠标键盘动作来完成复杂的任务。它利用VLM和强化学习环境,可以在真实计算机屏幕上执行多步骤任务。