Suno AI评测数据揭秘:千人盲听行动用户为何认真写评价?
本文深度解析Suno AI评测千人盲听行动的后台数据。了解真实听众如何从人声、咬字到编曲给出专业反馈,助你掌握AI音乐模型对比技巧,优化你的Suno AI写歌体验与创作方向。

但真正开始之后,我们发现另一个现象更值得记录。
从后台数据来看,参与者的投入程度超出了我们的预期。很多人会认真听、反复比较,甚至主动写下自己对每一首作品的具体评价。
大家比我们预想中,听得更认真
为了保证每一次判断建立在真实试听的基础上,我们规定每首作品至少播放 20 秒,才算一次有效收听。
但活动开始后,用户对每一首作品的平均收听时长超过了 1 分钟。

这意味着,大多数参与者都愿意把两首作品多听一会儿,再判断自己到底更喜欢哪一首。
这种认真也体现在评测完成度上。
进入评测之后,最终完成六轮盲听的用户比例超过 85%。
按照我们的规则,完成六轮就已经算正式完成本次听审。但我们还额外开放了六轮可选评测:如果愿意继续贡献数据,可以再听六轮,最多完成十二轮。
让我们有些意外的是,在已经完成规定任务的用户中,仍然有 22% 的人主动选择继续,把额外六轮也做完。
对于一个需要持续听歌、比较和判断的评测来说,这个数字比单纯的参与人数更让我们高兴。
因为它说明,很多人是真的对“这些模型到底谁做得更好”产生了兴趣。
更意外的是,42.1% 的人愿意告诉我们“为什么”
每一轮盲听,我们实际上设计了三层反馈。

第一层,是最简单的选择:作品 A 更好、作品 B 更好、差不多,或者两首都不喜欢。
第二层,是选择主要原因,例如人声是否自然、中文咬字是否清晰、旋律是否抓耳、编曲和结构是否完整、情绪是否到位等。
第三层则完全是可选的,我们留了一个补充说明框,希望听众如果有更具体的感受,可以自由写下来。
最初,我们只是把它当作一个补充入口,并没有预期会有多少人填写。
实际结果是,42.1% 的用户主动留下了文字评价。
有人会具体指出某一首作品的人声更加自然,有人觉得旋律不错但后半段结构开始失控,也有人会谈中文咬字、情绪表达、编曲层次,甚至写下自己为什么犹豫了很久才作出选择。
这些内容让我们意识到,这次评测最终留下的,可能远不只是一组“A 赢了还是 B 赢了”的胜负数据。
一张榜单能够告诉我们用户更喜欢谁,而这些主动写下来的评价,则进一步回答了另一个更重要的问题:他们为什么喜欢,或不喜欢。
如果你还没参加,这场评测其实很简单
看到这里,可能还有很多人并没有参加过这次评测。
「AI 音乐评测 · 千人听审行动」是谱乐 AI 发起的一次公开盲听评测,我们把 Suno V5.5、Google Lyria 3.5、Mureka V9.5、MiniMax Music 3.0、Happy Shrimp 五个主流 AI 音乐模型放到同一套测试体系里,使用统一题目和测试条件生成作品,再完全隐藏模型名称,由真实听众判断自己更喜欢哪一首。
参与并不需要懂乐理,也不需要了解模型参数。每个人只需要完成 6 轮匿名盲听,每轮认真听完作品 A 和作品 B,再选择自己更喜欢的一首,并告诉我们主要原因。如果还意犹未尽,也可以继续完成额外 6 轮,为评测贡献更多数据。
全部结束之后,你才会看到刚刚每一轮听到的究竟是什么模型,也能看到自己的听觉偏好。

完成有效听审后,你还将获得 「AI 音乐共评人」身份,名字会进入最终发布的《AI 音乐模型评测报告》署名页,同时获得专属的 唯一编号数字证书、积分奖励以及首批长期听审员资格。

我们希望参加它的门槛很低,同时让每一个人的判断都能被认真对待。
如果你还没有参加,欢迎来听听看,也留下你的答案。
点击文末「阅读原文」,进入千人听审。