6 月 6 日消息,stability ai 立足 stable diffusion 文生图模型,进一步向音频领域拓展,推出了 stable audio open,可以基于用户输入的提示词,生成高质量音频样本。
stable audio open 最长可以创建 47 秒的音乐,非常适合鼓点、乐器旋律、环境音和拟声音效,该开源模型基于 transforms 扩散模型(dit),在自动编码器的潜在空间中操作,提高生成音频的质量和多样性。
stable audio open 目前已经开源,代码网附上相关链接,感兴趣的用户可以在 huggingface 上试用。据说它使用了来自 freesound 和 free music archive 等音乐库的 486000 多种采样进行训练。
stability ai 公司表示:“虽然它可以生成简短的音乐片段,但并不适合完整的歌曲、旋律或人声”。
stable audio open 和 stable audio 2.0 不同是,前者为开源模型,专注于短音频片段和音效,而后者能够生成最长 3 分钟的完整音频。
发表评论