首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· 国产视频制作之光-可灵:提示词大全整理
· 建议收藏:超详细ChatGPT(GPT 4.0)论文润色指南
· 分享一个结构化AI提示词模版
· 不会PS也能做神图?豆包AI绘画全解析,让你的创意秒变艺术品!
· MiniCPM 4.1 开源!代码、数学推理速度快了 3 倍!
· ChatGLM智谱清言
· 完整ChatGLM3部署教程,支持手机和车载平台部署
· 中文通用大模型评测基准发布,全方位解析评价维度,助你选出最优秀的模型!
· 用Midjourney给自己制作精美的logo或头像
· 和大模型相关的一些术语(持续更新中)
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
开源
有感情的语
音
合成开源模型:ChatTTS安装使用详解
ChatTTS是一个为对话场景设计的语
音
生成模型,专门用于大型语言模型(LLM)助手的对话任务、对话语
音
和视频介绍等应用。
ChatTTS
语音合成
视频
Wunjo AI: 合成和克隆英语/俄语/中文语
音
,实时语
音
识别,深度换脸和唇动合成,通过文本提示更改视频,分割和修饰
主要特征 语
音
合成:轻松将文本转换为类似人类的语
音
。
AI语音克隆
实时语音识别
Stable Diffusion
小白设计师福
音
:Stable Diffusion 16款插件测评,好用不?推荐吗?
#65039;⭐️⭐️ 能做什么:Ultimate SD Upscale 是一款强大的图像超分辨率工具,可用于将低分辨率图像提升到高分辨率、减少噪
声
和模糊
SD
插件
文生图
大模型
大模型RAG检索增强问答如何评估:噪
声
、拒答、反事实、信息整合四大能力评测任务探索
为此,噪
声
鲁棒性测试根据所需的噪
声
比,将外部文档包含一定数量噪
声
文档的实例包含在内。
大模型
RAG检索增强
被高估的Pika,被低估的多模态AI
例如,在医疗领域可以通过结合图像、录
音
和病历文本,提供更准确的诊断和治疗方案;在交通领域,结合图像和传感器数据,带来更智能、更安全的自动驾驶体验;在教育领域,将文本、
声
音
、视频相结合,呈现更具互动性的教育内容
大模型
多模态
OpenAI
两天star量破千:OpenAI的Whisper被蒸馏后,语
音
识别数倍加速
懂技术的小伙伴也可以寻找其他替代方案,比如语
音
转文字模型 Whisper、文字翻译 GPT、
声
音
克隆 + 生成
音
频 so-vits-svc、生成符合
音
频的嘴型视频 GeneFace++dengdeng。
语音
HeyGen
开发语
音
产品时设计唤醒词和命令词的技巧
命令词中字的
音
节较长且相邻汉字的
声
韵母区分度越大越好; 3.
语音产品
唤醒词
命令词
数字人
一款构建AI数字人项目开源了!自动实现
音
视频同步!
本周GitHub项目圈选: 主要包含
音
视频同步、多代理框架、3D对象模型、适用于开发者的演示文档构建工具、网页程序打包、自构建CRUD应用等热点项目。
AI数字人
音视频同步
懒人福
音
!用AI生成会议纪要,让你的工作更高效!
**环境适应性**:AI系统可以在各种噪
声
环境下工作,不受会议室环境的影响。
会议纪要
AI工具
Stable Diffusion
stable diffusion最全18种controlnet模型,详细教程讲解。
等到年底的时候做一个最全面的视频和文字讲解,现在还是在等等,目前AI领域热度确实是在持续降温,但是呢,深入了解AI的人都知道,AI的发展不是想人一样需要很长时间的积累,有时候可能就是一个算法的突破,就能应用到文字,图像
声
音
等
Stable
Diffusion
文生图
controlnet
VividTalk:用一张照片和一段
音
频让人物栩栩如生地说话
最新的突破来自VividTalk项目,这是一个能够将单张照片和一段
音
频结合起来,创造出仿佛真人在说话的视频的技术。
VividTalk
视频
人工智能
胎教级SO-VITS-SVC使用教程:人工智能生成歌曲
sd生成的话筒xswl 原始歌曲处理(人
声
和伴奏分离) 如果想要使用孙燕姿的模型进行二次创作,首先需要一段已经准备好的
声
音
范本,然后使用模型把原来的
音
色换成孙燕姿模型训练好的
音
色即可 这里我们五月天的
音乐
开源
OpenAI 开源语
音
识别 Whisper 的使用体验怎么样?
关于Buzz Buzz 是一款基于 OpenAI 开源 Whisper 自动语
音
识别模型的软件工具,能够将
音
频或视频中的语
音
自动识别为带有时间戳的文本字幕。
生成式AI
开源
网易有道强力开源中英双语语
音
克隆
其中的
音
素(phonemes)可以这样得到: python frontend.py data/my_text.txt > data/my_text_for_tts.txt. 5.
语音
开源
开源
从 GPT-4o 到 LiveKit:实时语
音
交互的开源实现
今天我们来聊聊OpenAI 发布会提到的实时对话语
音
技术。
GPT-4o
语音交互
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100