首页
Ai 资讯
Ai 知识库
创作魔法
绘画魔法
视频魔法
训练魔法
Ai术语
Ai提示词
Ai创意图
Ai工具
Ai视频
VIP专区
VIP专区
登录
AI魔法学院客服
最新
排序
收藏
全部
七天内
一个月内
选择分类
全部
写作魔法
绘画魔法
视频魔法
训练魔法
其他
AI工具
VIP视频
推荐阅读
换一批
· GitHub狂飙3万star的LLM公开资料 - 大模型入门教程
· 实测:本地跑llama3:70B需要什么配置
· 火山写作
· 数字人:从科幻走向现实的技术革命
· 建议收藏:超详细ChatGPT(GPT 4.0)论文润色指南
· 耗时80小时!超详细的胎教级Stable Diffusion使用教程,看这一篇就够!
· Agent : 一文读懂LLM Agent架构,详解Profile,Memory,Planning,Action模块作用
· 在 WebUI 中使用 AnimateDiff 的一些问题和技巧
· 超详细的 Stable Diffusion ComfyUI 基础教程(三):Refiner 细化流程
· 详解Stable Diffusion提示词prompt语法
热门标签
Stable Diffusion
stable diffusion
Midjourney
midjourney
ComfyUI
comfyui
ChatGPT
chatgpt
大模型
数字人
开源
人工智能
Sora
文心一言
天工
零一万物
知海图
星火
文心一格
混元
通义千问
盘古
言犀
ChatGLM
Github
微软
热门标签
免费
教程
插件
免费
教程
插件
免费
教程
插件
文章列表
OpenAI
【
语
音
识别】OpenAI
语
音
力作Whisper
这么多的标注数据使得我们可以直接在 有监督
语
音
识别任务上预训练Whisper,从标注
音
频转录数据中直接习得
语
音
到文本的映射。
语音转文字
whisper
关于AI声
音
生成的一切(
语
音
+
音
乐+嘴型)
PRETSSEL是一个表达性单元到
语
音
生成器,能够有效地从
语
音
中分离
语
义和表达性成分,并转移话
语
级别的表达性,如个人的声
音
风格。
声音
大模型
“实时”
语
音
翻译!AI
语
音
具有“情绪”!最强开源AI大模型来了
你想把一段
语
音
转成文字,或者把一段文字转成
语
音
,但是你不知道怎么操作!
大模型
开源模型
语音
开源
网易(TTS)EmotiVoice:开源
语
音
合成,支持2000多
音
色
你是否曾经想过,如果你能用一句简单的提示来控制你的
语
音
合成器,那该多方便?
EmotiVoice
语音合成
字正腔圆,万国同
音
,coqui-ai TTS跨
语
种
语
音
克隆,钢铁侠讲16国
语
言
按照固有的思维方式,如果想要
语
音
克隆首先得有克隆对象具体的
语
言
语
音
样本,换句话说,克隆对象必须说过某一种
语
言的话才行,但现在,coqui-ai TTS V2.0版本做到了,真正的跨
语
种无需训练的
语
音
克隆技术
coqui-ai
TTS
语音
开源
十大开源
语
音
识别项目
这项技术在多个领域有着广泛的应用,包括但不限于
语
音
助手、
语
音
搜索、自动转写以及
语
音
命令识别。
语音识别
开源项目
实时
语
音
克隆
项目简介 这份内容介绍了实时
语
音
克隆的技术实现,作者通过将说话者验证技术转移到多说话人文本到
语
音
合成(SV2TTS)来实现
语
音
克隆。
语音
克隆
Insanely Fast Whisper:超快的Whisper
语
音
识别脚本
项目简介 这篇内容介绍了OpenAI的Whisper Large v2
语
音
转录模型的超快速能力。
音频
Whisper
语
音
克隆又又又又又升级了
,时隔几个月Meta又推出了最新的
语
音
生成技术,不仅能可能声
音
,还能通过对声
音
的描述来生成独特的
音
色,同时还能通过描述来生成各种各样的
音
效,甚至能通过文字描述来编辑声
音
,整体来说,这项技术几乎囊括了现在人们对
语
音
生成技术的所有的需求
Meta
语音生成
开源
语
音
、视频转文字神器:开源whisper介绍
OpenAI的Whisper是一种基于深度学习的
语
音
识别模型,它是一种通用的
语
音
识别模型,可以用于
语
音
识别、
语
音
翻译和
语
言识别等任务。
人工智能
大模型
wisper
视频
Wunjo AI: 合成和克隆英
语
/俄
语
/中文
语
音
,实时
语
音
识别,深度换脸和唇动合成,通过文本提示更改视频,分割和修饰
主要特征
语
音
合成:轻松将文本转换为类似人类的
语
音
。
AI语音克隆
实时语音识别
OpenAI
OpenAI大动作:Whisper large-v3重塑
语
音
识别技术
这款最新的自动
语
音
识别模型不仅在多
语
言识别方面取得了显著进步,而且还将很快在OpenAI的API中得到支持。
Whisper
语音识别
开源
【开源项目】Flow Matching
语
音
合成
CFM是一种新技术,已被证明可以改进扩散模型,Meta的Voicebox模型将CFM引入
语
音
合成领域,下面是voicebox的一个工作流程图 Matcha-TTS是第一个开源conditional
音视频
Flow
Matching
视频
栩栩如生,
音
色克隆,Bert-vits2文字转
语
音
打造鬼畜视频实践
语
音
素材和模型 首先我们需要渣渣辉和刘青云的原版
音
频素材,原版《扫毒》素材可以参考:https://www.bilibili.com/video/BV1R64y1F7SQ/。
Bert-vits
语音
开源
网易有道强力开源中英双
语
语
音
克隆
其中的
音
素(phonemes)可以这样得到: python frontend.py data/my_text.txt > data/my_text_for_tts.txt. 5.
语音
开源
<
1
2
3
4
5
6
7
8
9
10
...
>
1
2
4
5
6
7
8
9
100