用Gemini制作咖啡馆BGM……谷歌Lyria 3.5实测体验

Photo of author

By Global Team

谷歌于 9 月 4 日(当地时间)将音乐生成模型 Lyria 3.5 接入 Gemini 应用和 API。Gemini 应用用户无需安装单独程序,就能在聊天窗口里直接制作歌曲。

在输入框的“+”按钮中选择“制作音乐”后,会出现 24 种模板。包括背景音乐、品牌短 jingles、生日祝歌、说唱对 battle 等。

只输入一句“制作一首融合原声吉他和舒缓钢琴的咖啡馆 BGM”,就生成了歌曲、标题以及专辑封面图片。

在指定了风格、节奏、乐器、演唱和分段歌词之后,还完成了一首 city pop 歌曲。提示词写得越详细,结果就越接近需求。

所有音轨都包含人耳无法察觉的 SynthID 水印。这是用于识别 AI 生成音频的手段。

Suno 虽然具备音轨分离和分段编辑等后期功能,但在 8 月的德国慕尼黑法院中被判定侵犯版权。谷歌则表示,只使用了拥有使用权限的数据来训练模型。

谷歌音乐生成模型“Lyria 3.5”生成的音乐示例“Dryer Love”正在播放。Lyria 3.5 可根据流派、氛围、演唱风格等条件生成音乐。(图片=谷歌)

谷歌将音乐生成模型 Lyria 3.5 重新纳入 Gemini 应用。该功能于 9 月 4 日(当地时间)公开。无需安装或注册任何额外程序,就能在 Gemini 聊天窗口中创作歌曲。以下是实测体验。

◆ 一句话就能生成歌曲

在 Gemini 输入框左侧的“+”菜单中,新增了“制作音乐”功能。无需安装单独程序,只要在 Gemini 聊天窗口中输入提示词,就可以生成音乐。

点击输入框左侧的“+”按钮后,在“制作图片”“制作视频”下方就能看到“制作音乐”选项。选择后,屏幕会展开 24 种模板。按用途分为声景、背景音乐、开场音乐、品牌短 jingles、铃声、生日祝福、说唱对 battle、团队助威歌、天气预报等。下方还有可选择长度、演唱、流派的按钮。

如果不用模板,直接在聊天框输入一句话也可以。笔者输入了“请生成一首融合原声吉他和舒缓钢琴的咖啡馆 BGM”。

结果生成了一首完整歌曲。Gemini 随即给出回应:“已生成一段温暖的咖啡馆氛围 BGM,原声吉他指法与舒缓钢琴旋律柔和地融合在一起。”歌曲标题是《Morning Light Through Lace》。同时还自动生成了带有百叶窗缝隙阳光的照片风格专辑封面。

我并没有单独要求标题和封面图,它们是在生成歌曲时一并完成的。

在 Gemini 中输入“融合原声吉他和舒缓钢琴的咖啡馆 BGM”后生成的《Morning Light Through Lace》。歌曲标题和封面图也无需额外请求就一并生成。(图片=Gemini 界面截图,Solution News 具守淡记者)

第二次尝试时,我把提示词写得更详细。风格指定为 city pop,节奏设为 110 BPM。乐器写明为复古电钢琴(Rhodes)、律动感十足的 slap 贝斯、柔和铜管组和 80 年代鼓机。

人声则明确为温暖而有律动感的女声。

结构也按段落进行了划分。前奏指定为轻快的鼓点和电钢琴 riff,尾奏则要求萨克斯独奏渐弱淡出。主歌和副歌中还加入了自己写的韩文歌词。

最终产出的歌曲标题是《새벽이 오기 전까지》。封面图呈现为霓虹灯映在水面的都市夜景插画。歌词中写到的“建筑之间散开的霓虹灯光”也被反映在了图像中。

用包含流派、节奏、乐器、人声风格、歌曲结构以及韩文歌词的提示词生成的歌曲《새벽이 오기 전까지》。根据输入歌词内容生成的封面图也一并完成。(图片=Gemini 界面截图,Solution News 具守淡记者)

只输入一句也能生成歌曲。不过,若想得到理想结果,就需要分别写明流派、节奏、乐器、声线性别和段落结构。这也意味着,想要正确使用提示词,必须对音乐术语有一定了解。

Lyria 3.5 除了 Gemini 应用之外,也可在 Google Flow Music、AI Studio 和 Google Vids 中使用。在 Google Vids 中,该功能向 AI Pro 和 Ultra 付费订阅用户提供。所有音轨都包含 SynthID 水印。谷歌说明称,这种水印不会被人耳察觉,也不会影响听感。若提示词要求生成特定歌手的声音或受版权保护的歌词,系统会予以拦截。

◆ 与 Suno 有何不同

在 AI 音乐生成工具中,使用最广泛的服务之一就是 Suno。两者相比,优势各有侧重。

Gemini 的优势在于可访问性。若你已经在使用 Gemini,就无需重新注册。可以在聊天窗口处理文档的同时,顺手生成音乐。歌曲标题和专辑封面同步生成,也为内容创作者节省了时间。它还与视频编辑工具 Google Vids、Flow Music 形成联动结构。

Suno 的优势则在后期制作。Suno 的付费套餐提供将完成的歌曲按人声、鼓、贝斯等轨道分别导出的 stem 功能。更高等级套餐还提供时间线编辑器,可修改特定片段的旋律或发音。它也支持保存常用的人声与风格组合。对于想把作品进一步打磨成正式音源的用户来说,这些差异很关键。免费套餐制作的歌曲不能用于商业用途,从付费套餐开始,作品权利才转移给用户。

在版权问题上,情况也不同。德国慕尼黑地方法院在 8 月针对德国音乐著作权协会(GEMA)起诉 Suno 的案件中,认定其侵犯版权。法院认为,GEMA 提交的 6 首歌曲以可被 Suno 模型再现的形式包含在模型中。Suno 主张模型并未存储歌曲,而只是通过数学方式学习了模式,但这一说法未被采纳。法院认为,选择训练数据并运营模型的主体是 Suno。该判决目前尚未最终确定。

谷歌则表示,Lyria 仅使用拥有使用许可的数据进行训练。IT 媒体 The Decoder 报道称,谷歌在发布 Lyria 3 Pro 时曾作出上述说明。不过,谷歌并未公开实际使用了哪些具体数据。

如果计划将其用于商业音频,这一点尤其需要确认。若是用于 YouTube 背景音乐或店内 BGM 等实际场景,应先在使用条款中确认权利范围。