全部文章
创作技巧··创作技巧 / AI写歌 / 音乐制作

Spotify推出对话式音乐助手:AI如何重塑音乐发现与创作

Spotify推出“Talk to Spotify”功能,用户可通过语音或文字与App互动找歌。文章深入分析了这一功能背后的“品味大模型”如何改变音乐发现机制,并强调了音乐人精准标注元数据的重要性,以确保作品能被AI助手有效推荐。

Spotify推出对话式音乐助手:AI如何重塑音乐发现与创作

你熬夜做的歌,听众到底靠什么找到你?Spotify 刚甩出个新答案:让人张嘴跟 App 说话。

Talk to Spotify 上线,动嘴就能收藏换歌关注人

7 月 14 日,Spotify 开始测试一个叫 Talk to Spotify 的功能,Premium 用户能用语音或文字,跟 App 一来一回地聊着找歌。

你说"放点我没听过的歌",它给你一批;再补一句"换成更轻快的",它当场调;看上某首,直接说"收藏这首""加进队列""关注这个人",它替你点完,手都不用动。它还能翻你的听歌历史答题,比如"我听 Bad Bunny 听了多少遍""我最近都在听什么风格"。这些以前是年底才打包成一张海报的东西,现在随问随答。

首批只在美国、爱尔兰、瑞典三地测,只支持英语,18 岁以上能用,iOS 安卓都有。别看只是个 beta,Spotify 的 Premium 用户是 2.93 亿。这个量级改入口,不是小打小闹。

而且它没把入口藏起来。就摆在 App 首页和"正在播放"页,一睁眼就看见。这摆法本身就是态度,Spotify 想让"跟 App 聊天"变成默认动作,而不是一个躲在角落的高级选项。

"不就是搜索框换聊天框"?这话只对一半

我扫了圈报道,标题清一色"ChatGPT 式音乐助手"。评论区更冲,好些人觉得,这不就把搜索框换成聊天框,脱裤子放屁。

这话,对一半,错一半。

对的地方是,交互确实变了,从"敲关键词"变成"说人话"。错的地方在于,它把事看小了。真正变的不是你怎么问,是它凭什么答。它答的时候手里攥着两样东西:一样是你多年攒下的听歌数据,你的口味它比你还清楚;另一样是它能跟着情绪实时改,你说"再嗨一点",它不重开一局,而是在原来的基础上拐个弯。

搜索框做不到。搜索框是死的,你问一次它吐一次,不认识你,也不记得上一句。对话式助手是活的,它带着你的历史、你的上下文往下走。把这俩混为一谈,跟把导航说成"电子版地图"一样,不懂你。

真主角叫"品味大模型",歌单要被它压扁

这步棋图的是把音乐发现的入口攥在自己手里。

5 月投资者日上,联席 CEO Gustav Söderström 抛过一个词,叫 Large Taste Model,品味大模型。意思是 Spotify 不打算从零训一个通用大模型,那是烧钱的军备赛,它玩不过巨头。它要干的,是把现成的通用 AI 套在自己独家的东西上,几亿人几十亿次的听歌行为。Talk to Spotify 背后跑的,正是自家 AI 加好几家外部模型,哪个任务用哪个,挑着来。

为什么急着上?因为外面的 AI 助手已经能推歌了。你打开 ChatGPT 说"推荐几首适合下雨天写代码听的",它给得有模有样。这对 Spotify 是威胁。发现这件事一旦跑到别人的对话框里,它就从"你听歌的地方"退化成"一个放歌的仓库",数据、粘性、话语权全流走。所以它得抢,把发现连同它产生的数据,死死焊在自己 App 里。

这里有个变化,很多人没琢磨透。过去你找歌,中间隔着一层又一层:编辑推荐位、算法歌单、热歌榜、搜索排序。这些中间层,正在被一句话压扁。 你不用点进"每日推荐"再滑到第七首,直接说"来点适合深夜、我没听过、别太丧的",一步到位。歌单还在,但按歌单找歌的那批人,正改口说话。

标签填不准,模型就把你的歌漏了

绕了这么大一圈,落到咱们自己身上。我的判断是,音乐这条链子的两头,都在被对话式 Agent 接管

你这头,做歌,早对话化了。敲一句"赛博朋克风、女声、副歌要炸",几分钟一首完整的歌就出来,词曲人声全齐。你不是在编曲软件里一个音符一个音符地抠,是跟一个 Agent 说话,让它替你干活。这体验你熟。

听众那头,找歌,现在也开始对话化。Talk to Spotify 就是这头的信号枪。以后普通人想听歌,越来越不会去搜索框敲字,而是张嘴一句"换点新鲜的"。

两头都在说话,中间那个又冷又硬的搜索框,正两头一起死

那问题来了。听众对着 App 说"来点更轻快、我没听过的独立音乐",凭啥被捞出来的是你的歌,不是别人的?答案有点反直觉:决定权不在听众手里,在那个替听众挑歌的品味模型手里。 它捞不捞你,取决于它读不读得懂你这首歌,情绪对不对、风格准不准、节奏拿捏没拿捏住。

这就把一件过去被当杂活的事,顶到了台前,你歌的标签和元数据。以前发歌,风格、情绪、流派那几栏,很多人随手一填,甚至懒得填。以后不行了。标签不再是发行表格里的附赠项,是你的歌被对话捞到的入场券。 你标"忧郁民谣"还是"深夜治愈",标得准不准,直接决定模型在听众说"来点治愈的"时会不会想起你。

与其蹭热词,不如把情绪标签填准

不用慌,但得转个念头。

别再只盯"这首歌够不够炸"。同样要紧的是,它够不够"被找得到"。情绪标对了吗,风格描述精准吗,元数据填满了吗。这些你以前觉得可有可无的细节,正变成你和听众那句对话能不能接上的关键一环。

诚实、精准地给歌打标签,比蹭一堆不搭的热词管用得多。模型不吃标题党那套,它只认你这首歌到底是什么。

音乐的入口正在从搜索框变成一句话,这事已经在发生,快慢而已。趁它还没铺到每个人耳边,早点把作品打磨到"一叫就到"。别等哪天模型都学会聊天了,才发现自己的歌,它读不懂。