
人工智能正深刻改变全球科技创新与文化生产形态。以大模型为代表的新一代人工智能技术,正在快速进入文学、视觉艺术、影视与音乐等领域,成为国际科技创新、文化表达与产业变革竞相布局的重要前沿方向。在这一背景下,音乐人工智能不仅关系到新型数字内容生产方式,也关系到人工智能时代音乐创作、传播和教育形态的深刻变化。
近日,中央音乐学院音乐人工智能与音乐信息科技团队正式发布高保真音乐生成大模型“韶元(Shao)1.0”。该模型在长时音乐音频生成、高保真人声演唱、多乐器协同编配以及复杂音乐结构建模等方面取得重要进展,形成了学校推进人工智能与音乐艺术深度融合的重要标志性成果。相比文本和图像等生成任务,音乐生成具有更高的多维复杂性:既需要建模旋律、节奏、歌词、人声演唱与多乐器协同等高层结构,也需要保持音色、瞬态、和声细节与整体听感质量,因此被普遍认为是人工智能生成领域最具挑战性的任务之一。

“韶元(Shao)1.0”面向长时、完整、高质量音乐作品生成任务,可生成包含歌词演唱、多乐器伴奏与完整编曲结构的歌曲作品,也可生成不同风格和形态的纯音乐作品。项目采用团队自主研发的高保真声学建模技术路线,构建了64层残差声学词元表示,将音乐音频组织为从粗到细的深层声学层级,使模型能够在统一声学空间中同时建模音乐整体结构与细节表达。

在生成框架上,系统采用粗到细的两阶段生成机制:先生成完整音乐的粗层声学骨架,再在同一声学词元空间中逐层补全精细声学细节;超分辨率模型在全曲尺度上进行细节重建,并在时间维度并行预测,形成固定步数的细化生成过程。与当前部分依赖语义中间表示、扩散式声学重建或复杂多阶段渲染的技术路线不同,“韶元(Shao)1.0”重点探索面向高保真音乐生成的统一声学词元路径,在音质表现、人声清晰度、伴奏融合度、长时结构稳定性与整体听感一致性等方面取得较好效果。

同时,团队围绕歌词与人声之间的时序绑定问题开展研究。对于音乐生成模型而言,能够读取歌词,并不意味着能够准确理解每个字词应当在何时、以何种方式被演唱。如果文本条件与局部人声生成之间缺乏稳定对应,容易出现歌词错位、漏唱、含混发音及“AI语”等问题。针对这一难点,团队在模型训练中引入时序绑定机制,增强歌词内容与音频时间轴之间的对应关系,从而提升歌词对齐、人声清晰度、演唱自然度与歌曲整体可控性。

该成果依托团队近年来在音乐人工智能、神经音频编码、大规模音乐生成模型与工程系统建设方面的持续积累完成。项目基于团队长期建设和整理的大规模音乐音频训练数据资源开展研究,覆盖多种语言、音乐风格和作品形态,为长时音乐结构建模、高保真人声生成和多乐器协同编配提供了重要支撑。当前发布版本包含两个10亿级参数模型,模型规模分别约为16亿和18亿参数,训练依托中央音乐学院超算中心建设的高性能计算集群,在64张 H800 GPU 上完成。围绕长时音乐建模、大规模多机多卡训练、模型推理部署与在线演示系统建设,团队形成了一套覆盖数据、算法、算力、训练、推理和应用展示的完整研发流程,该成果充分体现了学校在音乐人工智能大模型方向开展系统性原创研究、稳定训练大规模模型的科研能力,也展现了学校高水平科研平台建设、人工智能算力资源配置与重大科研成果产出之间的综合支撑能力。

在大规模人类盲评测试中,“韶元(Shao)1.0”取得开源音乐生成模型世界第一的成绩,部分维度接近甚至超过国际商业系统表现,展现出中国高校团队在音乐生成大模型方向的自主研发能力和国际竞争力。相关研究成果已面向国际学术社区公开发布,同步开放论文、模型权重、推理代码与在线音乐生成演示系统。项目团队希望通过“韶元(Shao)”系列模型的持续迭代,进一步推动我国在人工智能音乐生成领域的自主创新能力建设,积极参与国际人工智能音乐科技前沿探索,为人工智能时代音乐创作、音乐教育、文化传播与数字内容生产提供新的技术支撑。
近年来,中央音乐学院持续推进音乐人工智能与音乐信息科技方向建设,围绕多模态音乐大模型、音乐生成、音乐信息检索、智能音乐教育等方向开展系统布局,积极探索艺术与科技深度融合背景下音乐学科发展的新空间。未来,学校将继续发挥音乐学科优势,推动科技创新与艺术创新协同发展,探索具有中国特色的AI赋能音乐教育未来新路径,为提升中国文化科技创新能力与国际影响力贡献力量。
GitHub 代码:
https://github.com/Shao-Music-AI/Shao
论文:https://arxiv.org/pdf/2605.01790
Demo 试听:
https://shao-music-ai.github.io/Shao-demo/
核心团队资料

刘家丰
中央音乐学院音乐人工智能与音乐信息科技系副教授,项目负责人、论文共同第一作者。主导项目总体技术路线、核心模型研发与工程系统建设,负责声学表示、音乐生成建模、大规模多机多卡训练、推理部署及整体研发推进。

董原良
中央音乐学院音乐人工智能与音乐信息科技系博士,项目核心研发成员、论文共同第一作者。深度参与核心模型研发、实验设计与大规模训练,负责模型实现、实验验证、推理优化及系统工程等工作。

孙茂松
清华大学计算机科学与技术系教授、清华大学人工智能研究院常务副院长,中央音乐学院音乐人工智能与音乐信息科技系兼职教授,欧洲科学院外籍院士,国际计算语言学协会会士、中国人工智能学会会士,国家重点基础研究发展计划(973计划)项目首席科学家。长期从事自然语言处理、人工智能、大模型及计算社会、人文与艺术研究。作为论文通讯作者和项目核心学术指导者,对项目总体技术路线、大模型建模方法、关键科研问题与学术创新方向进行把关,为核心模型研发和研究工作的持续推进提供了重要指导。

李小兵
中央音乐学院教授、博士生导师、音乐人工智能系主任,国家哲学社会科学领军人才,国家社科重大项目首席专家,中国人工智能学会艺术与人工智能专委会主任。作为项目关键指导者,对项目总体定位、音乐与人工智能交叉研究方向及阶段性目标进行指导,深度参与模型研发,并对生成结果的音乐性、艺术表现与整体质量进行把关。同时在团队组织、科研条件和项目持续推进等方面给予关键支持。
博士生导师:俞峰教授、孙茂松教授
项目指导教师:孙宇明副教授
其他主要参与人员:刘洪嘉、程煜晴、郭展成、梁慧菁、詹文博
上述成员围绕项目学术指导、模型研发、实验训练、系统建设与音乐评测等工作作出了重要贡献。
供稿:音乐人工智能与音乐信息科技系
设计:王佳瑶