智能时代的算法治理:大模型技术与合规实践

978-7-115-68529-2
作者: 邓辉张文娟贺敏张震艾政阳
译者:
编辑: 顾慧毅
分类: 其他

图书目录:

详情

以ChatGPT、文心一言等为代表的大模型展现出前所未有的内容生成、逻辑推理和多模态理解能力,正深刻重塑着各行各业的经济形态和社会运行模式。本书旨在帮助企业构建稳健的合规体系,从而在智能时代的竞争中行稳致远。本书共6章,首先,梳理全球大模型的发展脉络、产业格局,以及国内大模型发展现状及挑战;其次,深入解读文本大模型、模型优化和多模态大模型技术的运行机理;进而系统剖析人工智能算法安全与应用安全的多维风险;接着,从法律层面评析国内外算法治理的法律现状与实施挑战;随后,结合中国企业实际,提出人工智能合规体系的构建思路与操作方案;最后,展望人工智能大模型的未来监管、治理框架和国际合作的可能方向,勾勒智能时代算法治理的动态图景。 本书适合人工智能开发者、服务提供商、法律与合规从业人员、政策制定者,以及希望深入了解大模型治理趋势的研究人员和大众读者阅读。

图书摘要

版权信息

书名:智能时代的算法治理:大模型技术与合规实践

ISBN:978-7-115-68529-2

本书由人民邮电出版社发行数字版。版权所有,侵权必究。

您购买的人民邮电出版社电子书仅供您个人使用,未经授权,不得以任何方式复制和传播本书内容。

我们愿意相信读者具有这样的良知和觉悟,与我们共同保护知识产权。

如果购买者有侵权行为,我们可能对该用户实施包括但不限于关闭该帐号等维权措施,并可能追究法律责任。

版  权

著    邓 辉  张文娟  贺 敏  张 震  艾政阳

责任编辑 顾慧毅

人民邮电出版社出版发行  北京市丰台区成寿寺路11号

邮编 100164  电子邮件 315@ptpress.com.cn

网址 http://www.ptpress.com.cn

读者服务热线:(010)81055410

反盗版热线:(010)81055315

内 容 提 要

以ChatGPT、文心一言等为代表的大模型展现出前所未有的内容生成、逻辑推理和多模态理解能力,正深刻重塑着各行各业的经济形态和社会运行模式。本书旨在帮助企业构建稳健的合规体系,从而在智能时代的竞争中行稳致远。本书共6章,首先,梳理全球大模型的发展脉络、产业格局,以及国内大模型发展现状及挑战;其次,深入解读文本大模型、模型优化和多模态大模型技术的运行机理;进而系统剖析人工智能算法安全与应用安全的多维风险;接着,从法律层面评析国内外算法治理的法律现状与实施挑战;随后,结合中国企业实际,提出人工智能合规体系的构建思路与操作方案;最后,展望人工智能大模型的未来监管、治理框架和国际合作的可能方向,勾勒智能时代算法治理的动态图景。

本书适合人工智能开发者、服务提供商、法律与合规从业人员、政策制定者,以及希望深入了解大模型治理趋势的研究人员和大众读者阅读。

前  言

开展企业合规工作,是深入贯彻党的二十大精神、贯彻落实习近平法治思想、服务保障中国式现代化、推动经济社会高质量发展的本质要求,也是通过法治化手段持续优化营商环境、全面落实产权平等保护政策的有力举措,具有重大的时代价值和意义。2023年7月,《中共中央 国务院关于促进民营经济发展壮大的意见》发布,提出“深化涉案企业合规改革,推动民营企业合规守法经营”,对进一步探索、研究和构建企业合规制度提出了更为迫切的需求。随着以ChatGPT为代表的生成式人工智能的突进与崛起,算法歧视、数据泄露、深度伪造、伦理失范等风险亦如影随形,引发全球范围内对人工智能治理的深度焦虑,这也促使企业合规跃升为法学的重要研究对象。中国企业如何实行行之有效的企业合规进路,成为关乎产业命运与国家竞争力的核心时代命题。

本书正是对这一时代命题的系统性回应。当前,人工智能治理存在三重断裂:其一,技术迭代与规则滞后的时间差距;其二,全球监管标准的地域割裂;其三,产业实践与学术理论的认知鸿沟。因此,融合技术逻辑、法律规制与伦理价值的动态治理框架的重要性更加凸显。这正是本书的独特价值所在,它既非技术手册,也非法律条文汇编,而是一部写给未来人工智能治理的工具书。对于政策制定者,它提供了技术中立的监管评估框架;对于技术研发者,它揭示了伦理设计前置化的实现路径;对于企业决策者,它给出了从数据治理到产品备案的“合规施工图”;对于公众,它用可视化的方式拆解了算法权力的运作逻辑。

人工智能治理唯一的正确答案是持续加深全球对话。当GPT-5、脑机接口技术等应用出现,人类社会比任何时候都更需要建立一种“谦卑的治理智慧”,即承认技术的复杂性,保持制度的开放性,坚守人类的价值锚点。本书可以为人工智能治理的全球对话提供“支点”,为构建“可信、可控、可用”的人工智能未来贡献中国方案与智慧。

本书主体内容撰写于2025年9月前,鉴于人工智能发展迅速,行业变化较快,后续若有法律法规或技术更新,敬请读者结合最新信息参照理解。

第一章
人工智能大模型的发展现状及分析

随着人工智能技术的不断发展,大模型已经成为该领域的一个重要发展趋势,大模型合规建设已然成为企业人工智能合规建设的核心板块。明确大模型的发展现状是开展人工智能合规建设的逻辑起点。本章将详细阐述大模型的概念、技术发展特征及产业发展现状。

一、全球大模型发展整体态势

大模型是指在海量数据上依托强大算力资源进行训练后能完成大量不同下游任务的模型。在技术层面上,大模型的实现采用“预训练+指令微调+基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,RLHF)”的训练范式。首先,通过预训练技术,让深度学习网络基于海量数据进行自监督训练;然后,利用指令对数据进行有监督的微调,提升模型对人类指令的追随能力;最后,基于由人类价值标注数据训练得到的奖励模型所提供的奖励信息进行强化学习,使大模型的输入符合人类的价值判断。使用大模型时,通过设计提示词让大模型进行即时学习,可以进一步提升大模型完成各类任务的能力。全球大模型发展呈现4个方面的特点。

1.大模型推动智能“涌现”,打开人工智能技术发展上限

规模化是使大模型强大的重要原因。研究表明,当模型规模足够大的时候,会“涌现”智能能力,具备处理新的、更高层次的特征和模式的能力,为一系列下游任务带来更好的处理效果。大模型的规模不断扩大,由“量变”引发“质变”,使得模型通用认知能力不断提升。大模型能力的迅速发展不仅有助于人类完成“规定动作”,还能帮助人类去研究和发现未知领域,突破前所未有的极限。

大模型的技术变革呈现数据巨量化、模型通用化、应用模式中心化的特点。整个发展历程可划分为3个阶段。

(1)深度学习阶段(2013—2018年)。该阶段主要采用传统的“针对特定任务的专用模型+大量标注数据”的方式,在监督学习的机制下训练得到一个个专用小模型。在词向量的自监督学习中,使用大规模数据进行预训练的方法已初见端倪。2017年,Transformer架构的提出为大模型基础架构带来了规模化构建和规模化运算的潜力。Transformer架构解决了循环神经网络(Recurrent Neural Network,RNN)和长短期记忆网络(Long Short-Term Memory,LSTM)的并行化训练和长距离依赖问题,以及卷积神经网络(Convolutional Neural Network,CNN)的局部归纳偏差问题,能够容纳更多的参数,并且具备更强的语义特征提取能力、长距离特征捕获能力、综合特征提取能力。

(2)预训练阶段(2019—2022年上半年)。该阶段基于海量无标注数据,在自监督学习机制下获得预训练大模型,通过少量标注数据微调后得到领域专用模型。自监督学习机制的成功使得可利用的数据愈发巨量化,从标注数据拓展到无标注数据。基于Transformer架构的双向编码表示(Bidirectional Encoder Representations from Transformers,BERT)模型将可利用的预训练数据量增加3~5倍,成为自然语言理解任务中的基准模型。自此,“预训练+微调”的学习范式成为主流,在通用大模型上通过少量标注数据微调,即可使模型适用于一系列下游任务。

(3)大模型阶段(2022年下半年以来)。该阶段预训练大模型的通用能力愈发强大,引入指令监督训练使得模型能更好地追随人类指令完成各种任务,并提升了模型在下游任务上的泛化能力,通过人类反馈学习让机器与人类价值对齐成为可能。

2.大模型变革内容生产和技术服务模式,“无限生产”推动生产效率颠覆式提升

内容生产方面,生成式大模型率先在内容创作、图像生成、数字人、游戏等娱乐媒体领域得到广泛应用,内容生产效率和质量显著提升,内容生产模式从辅助人向“替代”人演变。据IT研究与顾问咨询公司Gartner预测,截至2025年底,生成式大模型产生的数据将占所有数据的10%。

技术服务模式方面,大模型的“无限生产”能力会重塑企业生产引擎。随着大模型能力的不断提升,人工智能代理(AI Agent)成为重要发展趋势。未来,大模型将不仅是一种生产工具,更是企业的“合作者”,能持续为企业注入生产动能。

3.大模型作为新的“根”基础设施,驱动人工智能范式变革

大模型实现模型生产从“作坊式”到“流水线”的升级。大模型出现以前,人工智能模型是“定制化、场景化”的开发方式,针对特定应用场景需求训练一个个小模型,模型难以复用和积累,导致人工智能落地的高门槛、高成本与低效率。

大模型实现了基础模型底座的标准化开发和泛在化应用,有效解决了成本困境。通用大模型通过从海量、多场景、多领域的数据中学习共性知识,构建具有通用性和泛化能力的模型底座。基于通用大模型可搭建各行业的垂类大模型,有效减少垂类大模型训练所需要的算力和数据量,缩短模型的开发周期,提升垂直领域的应用开发效率。OpenAI以GPT-4通用大模型为底座,通过快速增量训练和个性化微调的方式,允许普通用户通过简易对话界面自定义GPT,支持开发者采用私有数据对GPT进行个性化微调,使大模型更易于被访问和开发,产品形态更加丰富,以满足更广泛的市场需求。

4.美国和中国是大模型领域的主要“玩家”,大模型市场竞争持续深入

2025年4月,斯坦福大学发布的《2025年人工智能指数报告》指出,美国和中国是全球标志性人工智能模型的主要发布国家。美国方面形成了OpenAI+微软、Meta、谷歌等多个“阵营”:OpenAI重点围绕GPT-4模型底座完善上层开发者生态;Meta通过开源大语言模型LLaMA(Large Language Model Meta AI)引领全球大模型开源浪潮。中国方面,大模型的发展再次体现出“中国速度”。中国信息通信研究院在2025世界人工智能大会上发布的监测数据显示,中国已发布1509个大模型,大模型数量居全球第一;中国人工智能企业超5100家,约占全球人工智能企业总数的15%。

中国工程院院士郑纬民在2023年11月发布的《北京市人工智能行业大模型创新应用白皮书(2023年)》中指出,美国作为全球科技霸主,一直引领人工智能领域的发展前沿,大模型的产业布局全面领先,在研发能力、人才储备、硬件设施及融资环境方面占据优势。相较而言,中国占据海量数据资源和应用场景的优势,但顶尖的人工智能人才缺乏,在基础理论、原创模型等方面仍缺乏引领能力。中国产业基础层的整体实力较弱,高质量数据积累不足,在高端芯片、关键基础软件等领域仍受制于美国。

二、人工智能生成内容技术的应用现状

ChatGPT、Sora等生成式大模型代表了一种新的内容生产形式——人工智能生成内容(Artificial Intelligence Generated Content,AIGC),AIGC极大地提升了人类社会的内容生产能力。从生成内容的角度出发,AIGC分为文本生成、图像生成、视频生成、音频生成、代码生成五个应用领域,如图1-1所示。

图1-1 AIGC技术特点、应用领域及产业链

1.文本生成领域

AIGC可应用在标题生成与新闻播报、剧情续写、营销文本编辑、相关内容推荐及润色、心理咨询、文本交互游戏等多个场景,可大幅提升文本内容的生产效率。目前,国内的AIGC多布局在结构化写作和辅助写作上,百度的文心一言在闲聊机器人领域展开了相关布局;国外的AIGC在结构化写作、非结构化写作、辅助写作、闲聊机器人、文本交互游戏等领域均展开布局,尤其是ChatGPT引领了人工智能聊天机器人的发展。文本生成模型大部分基于 Transformer架构演变而来,预训练大语言模型(Large Language Madel, LLM),如GPT、BERT、T5等,是表现最为突出的。国内大多数文本生成模型已接近GPT-3的水平,并在不断地迭代提升。文本生成模型的文本生成方式比较多样:新闻写作、公司财务报告撰写、客服问答等领域的结构化文本生成,典型模型有Writesonic、Smartwriter等;营销文本和剧情创作等领域的非结构化文本生成,典型模型有Copy.ai、Jasper、Snazzy等;虚拟伴侣、非玩家角色(Non-Player Character,NPC)互动等领域的交互性文本生成,典型模型有文心一言、小冰、聆心智能、ChatGPT等。

国外知名的代表性文本生成模型包括OpenAI的聊天机器人ChatGPT系列、谷歌的聊天机器人Bard、人工智能文案生成助手Copy.ai、文字编辑优化类产品Notion AI等。ChatGPT是基于超大语料库的预训练LLM,锻造出了一个能够学习和理解人类语言,与人类进行对话,根据上下文进行互动,并协助人类完成一系列任务的聊天机器人。ChatGPT所依托的基础模型是在GPT-1、GPT-2、GPT-3基础上进一步迭代的GPT-3.5,训练参数量为1750亿。Bard是基于大模型LaMDA开发的实验性人工智能程序,于2023年5月更新为谷歌的大模型PaLM 2,训练参数量为 3400亿,面向全球 180个国家和地区的用户开放英语访问。Copy.ai是基于GPT-3的文本生成工具,包含 1750亿个参数,可应用于商业文章写作、营销文案、产品描述等场景,可将文案创作的构思阶段时间缩短 80%以上。已经有超过 200万名用户在使用 Copy.ai,包括微软、eBay 及雀巢等公司的员工。Notion AI基于GPT-3,具有智能化的协作、搜索、分类和推荐功能,具体包括生成新内容、编辑现有内容、总结内容、翻译内容等,正应用于知识管理、团队协作、个人笔记等领域。

国内知名的代表性文本生成模型包括百度的文心一言、腾讯的自动写作机器人Dreamwriter、字节跳动的新闻写作机器人XiaomingBot等。文心一言是国内首个类ChatGPT产品,尽管在模型的能力水平上,文心一言与ChatGPT有一定差距,但与下游应用逐步对接后,它有望依靠合作伙伴的高质量数据集快速提升模型能力。根据百度文心大模型的全景布局,文心一言有望通过飞桨开源开放平台、百度智能云等赋能工业、能源、金融、通信、媒体、教育等各行各业,通过接入合作伙伴的方式,进一步获取高质量数据集以强化模型的训练与调整,快速提升模型性能。

2.图像生成领域

图像生成是指运用人工智能技术,根据给定的数据进行单模态或跨模态生成图像的过程。应用场景包括图像编辑工具、图像自主生成、文字生成图像等。国内外的市场主体在文字生成图像、图像属性编辑、图像部分编辑、图像端到端生成等领域均有布局,在文字生成图像领域,国外的技术更成熟。目前,图像生成模型架构实现了从计算机视觉(Computer Vision,CV)领域中的生成对抗网络(Generative Adversarial Network,GAN)技术到主流的扩散模型(Diffusion Model)技术的跨度,如Stable Diffusion、Midjourney、ERNIE-ViLG等都是基于扩散模型技术构建的图像生成模型。图像生成技术的前沿探索主要聚焦在如何加强对图像实体关系的深度理解、提升多模态间转换的生成效果、提高采样速度和对样本质量的研究等方面,以提升模型对复杂和抽象任务的图像生成效果,形成更强的跨模态能力和实用性。2023年4月以来,SAM、SegGPT、Grounded-SAM、即梦、豆包等大模型接连诞生。其中,SAM 是由Meta发布的图像分割大模型,能够识别并分离图像和视频中的特定对象;SegGPT更偏重批量化标注分割能力;Grounded-SAM可以通过文本描述找到图像中的任意物体,这些新技术可以识别图像和视频中的各类物体,意味着CV领域或将迎来颠覆。随着我国自主研发模型技术的不断进步,文心一格、CogView、ZMO等人工智能模型通过调优和知识增强训练,对中文提示词具备更强的理解能力,在美术创作、广告设计等领域已经有了一定的用户基础,但这些模型对图像实体关系的深度理解还存在不足,仍然需要继续进行深度打磨。

国外主流的图像生成模型包括Midjourney、Stable Diffusion、DALL·E2。Midjourney是基于扩散模型精调后的图像生成模型,采用闭源付费模式。精调后的Diffusion Model被部署在Discord平台上,用户通过与机器人Midjourney Bot进行对话式交互,选择不同的主题、风格和分辨率,来生成图像作品。Midjourney的主要特点是可将文字转化为图像且突出细节,尤其适合人像。Stable Diffusion是一种基于扩散模型的深度学习模型,采用先进的概率推理算法,只需要上传1张图像,平台就会自动生成 3张联想图像,并且支持更细致的编辑。Stable Diffusion完全开源,模型优化迭代速度快,拥有较好的开发者生态,盈利手段主要是通过应用程序接口(Application Program Interface,API)收费和为面向专业领域的B端用户提供定制化模型服务,主要特点是原创性强、渲染的图像更加真实。Stable Diffusion可以作为应用插件嵌入Adobe Photoshop,支持直接在Adobe Photoshop上生成图像并保存。DALL·E2基于语言—图像对比预训练(Contrastive Language-Image Pre-training,CLIP)模型和文生图模型,通过百亿级大规模参数集进行训练,能够形成稳定且高质量的图像,对复杂文字的理解更准确,但它的使用限制多且生成图像的艺术性不高。目前,DALL·E2采取闭源付费模式,依托OpenAI与微软的深度合作关系,搭载ChatGPT并将产品嵌入微软的办公生态。

国内主流的图像生成模型包括百度的文心一格、退格数据的Tiamat等。文心一格将百度文心知识增强算法和混合专家(Mixture of Experts,MoE)扩散模型建模的ERNIE-ViLG 2.0作为人工智能绘画的大模型底座,并将“文生成图”和“图生成文”两种任务融合到同一个模型中进行端到端学习,从而增强文本和图像的跨模态语义对齐。文心一格在多模态交互方面具有明显优势,提供面向C端用户的免费和付费模式,主要辅助艺术创作,为媒体、作家等文字内容创作者提供高质量配图。Tiamat采用自研的MorpherVLM,是国内首个基于概念融合范式提出的近百亿级跨模态生成模型,通过异构的视觉编码器-解码器网络结构,并引入RLHF和细粒度的提示隐变量对齐技术,提高模型对图像多尺度信息的建模能力。Tiamat可以结合已知文本或图像文件,自动生成新的数字图像内容,主要面向C端市场,只有大概20%的用户是B端的设计师。2023年,Tiamat获得数百万元合同订单,与知名科幻IP(Intellectual Property)持有方、央视网等媒体或平台建立了合作。

据《中国新闻周刊》报道,2023年9月,Midjourney已经拥有150万用户,短短一个月后,其用户量快速翻了5倍。DALL·E2可以让一组人工智能绘画里的人物形象保持一致,从而被应用于漫画和动画的创作。OpenAI的CLIP技术可以直接用人工智能制作动画,由CLIP技术生成的短片《乌鸦》(The Crow)获得了2022年戛纳国际电影节最佳短片奖。

3.视频生成领域

视频生成技术可以利用算法生成、编辑、合成视频,从而实现从人物造型到场景布置等视频影像的自动化生成,主要的应用领域有剪辑生成、特效生成和内容生成等。视频生成技术的发展可以分为图像拼接生成、GAN/变分自编码器(Variational Auto-Encoder,VAE)/Flow-based生成、自回归和扩散模型生成等几个关键阶段。但由于视频数据的复杂性,相较于文本生成和图像生成,视频生成技术仍处于探索期,各类算法和模型都存在一定的局限性。在AIGC视频生成领域,国外偏向于技术,而国内偏向于应用。国内典型的应用软件有字节跳动的剪映、快手的云剪、不咕剪辑的Cooclip、网达软件的智能云剪系统等。现阶段,视频生成方面的探索主要聚焦高分辨率视频生成、超长文本视频生成、无限时长的连贯视频生成等,可将文生图模型的研究成果引入视频生成模型,并对模型性能进行优化。随着我国视频技术的发展,生成式人工智能技术将进一步被运用到脚本创作、视频剪辑、渲染、特效等视频制作的流程中。目前,视频生成还有很大的潜力尚待挖掘,模型性能与产品化落地之间仍然存在不小的差距。

美国在视频游戏、电影、广告等领域已经开始大量应用AIGC视频生成技术。国外主流的视频生成模型包括Sora、Make-A-Video、Runway、Imagen Video、Phenaki等。Sora是OpenAI发布的一款人工智能视频模型,结合了扩散模型和Transformer架构,能够通过简单的文本命令创建出高度逼真、包含复杂背景和多角度镜头的视频。Sora继承了DALL·E3的画质和遵循指令的能力,根据用户的文本提示创建逼真的视频。Sora可以深度模拟真实的物理世界,理解用户在提示词中提出的要求,并了解这些物体在物理世界中的存在方式,生成具有多个角色、包含特定运动的复杂场景。Meta 于 2022年 9月发布Make-A-Video,该模型由拥有几百万个视频和23亿张图像的训练数据集训练而成,通过时空分解扩散模型将基于扩散的文生图模型扩展到文生视频模型,先生成1张连续的 64像素×64像素的RGB图像,再将其提升至768像素×768像素,从而生成高分辨率和高帧率的视频。目前该模型尚未开放测试。Runway是目前AIGC视频领域的标杆,可利用纯文本、文字配图或单张图像生成视频。Runway主要搭建在Discord平台上,需要用户在Discord频道中输入指令,进而输出新的视频内容。Runway的Gen-1模型可以通过提供初始视频、叠加文字提示语或图像提示生成新的视频,Gen-2模型的功能包括文生视频、文本+参考图像生视频、静态图像转视频,可以实现从零开始自动创作短视频。目前,Gen-1采取付费订阅模式,提供有限次数的试用;Gen-2开放免费试用服务。在产品生态上,Runway选择跟大量的导演和视频创作者进行合作,已在多部电影创作中发挥作用。谷歌发布的文本内容生成短视频工具Imagen Video是基于级联视频扩散模型的文本条件视频生成系统,可以生成一个每秒3帧、分辨率为 24像素×48像素的 16帧电影。Imagen Video不仅可以生成高清视频,还具备非结构化生成模型所没有的独特功能,如从数据中学习视频风格、3D效果等。谷歌的另一款视频工具Phenaki则主打延长视频长度,模型采用了一个将视频压缩为离散嵌入的编码器-解码器模型和一个将文本嵌入转换为视频词元(Token)的Transformer架构,可根据一段较长的文字故事生成2分钟以上的视频。Stability AI在2023年发布的Stable Video Diffusion是一个采用Stable Diffusion架构的视频生成大模型。谷歌还分别在2023年和2024年发布了两款视频生成大模型:VideoPoet和Lumiere。VideoPoet基于LLM实现视频生成;Lumiere采用全新的STUNet(Space-Time U-Net)架构,旨在解决人工智能视频生成中视频长度不足、运动连贯性低及伪影等问题。

国内主流的视频生成模型包括清华大学和智源研究院联合开发的CogVideo、快手的可灵AI、字节跳动的即梦AI、百度的VidPress等。CogVideo完全开源,含94亿个参数,将CogView2模型有效地利用到文本-视频模型中,并使用了多帧率分层训练策略,将多帧连续图像制作成视频。可灵AI是由快手人工智能团队对标Sora自主研发的视频生成模型,提供文生视频、图生视频两种模式,生成的视频分辨率可达1080 P,时长最高可达2分钟(帧率为30帧每秒)。即梦AI具有人工智能图像创作、视频创作等功能,截至2025年8月,即梦AI已更新至3.1版本。VidPress是基于文心大模型的智能视频合成产品,只需输入新闻的图文内容链接即可生成视频,提供视频素材智能化聚合、解说词生成、语音合成、音视频对齐和渲染导出等功能,平均每天可以生产500~1000条视频,主要应用于百度的好看视频平台。阿里云在2023年推出的视频生成大模型I2VGen-XL可以根据输入的文本或图像、指定的运动或主体,甚至人类提供的反馈信号生成高质量的视频。近些年,越来越多新技术的出现也为视频生成大模型的发展提供了广阔的思路。

4.音频生成领域

音频生成领域的关键技术包括自然语言处理(Natural Language Processing,NLP)技术、音频合成技术、深度学习技术、声音效果处理技术和信号处理技术,多应用于音乐制作、语音识别和语音合成。随着计算机技术的发展,音频生成逐渐形成了以“文本分析—声学模型—声码器”为基本结构的语音合成方法。基于对这个结构部分模块的替代或优化,音频生成的关键技术大致经历了拼接合成、参数合成、端到端合成三个阶段。音频生成作为一种比较成熟的技术,已经具备产业化应用的能力。近年来,国外头部科技公司,如微软、亚马逊、谷歌、苹果等,均展开了音频生成技术研究,并在智能语音市场积极布局。微软收购语音厂商Nuance,提供语音定制开发;亚马逊的Alexa、谷歌的Assistant、苹果的Siri等产品以语音助手的形式搭载在家居设备或手机上。国内智能语音市场规模保持稳定增长,头部厂商,如科大讯飞、百度、阿里巴巴,向多个专业领域渗透,聚焦智能家居、车载等场景,并向电商、金融、医疗、教育等行业提供语音客服、营销平台等定制化服务。

国外主流的音频生成模型包括谷歌的AudioLM、MusicLM和Tacotron2等。AudioLM基于大模型的训练原理,通过Transformer架构对语义标记和声学标记进行建模训练,可根据音频提示进行语义信息推理,生成语音或钢琴音乐。AudioLM无须在标注数据上训练就能够保留原提示音频的说话人特征或乐曲风格,还利用SoundStream神经编解码器产生的声学标记捕捉音频波形的细节,进行高质量的合成。谷歌音乐生成工具MusicLM 可以根据输入的文字、图像和标题的组合,生成相应风格的音乐。为了提升音频生成的质量,MusicLM在免费音乐档案馆(Free Music Archive, FMA)数据集上训练了 SoundStream 和 W2V-BERT 模型,可以生成比其他基于文本生成的音频质量更高的音频。然而,由于MusicLM可能涉及盗用创意内容的潜在风险,目前尚未发布。谷歌的语音合成系统Tacotron2是在结合WaveNet和Tacotron的基础上,由声谱预测网络和声码器构成的端到端语音合成模型。其中,序列到序列的预测网络将提取的文本特征输入模型,并将预测值叠加到梅尔频谱上;声码器根据预测的序列生成时域波形。Tacotron2拥有80个维度的声谱,不仅可以捕捉单词的发音,还可以感知人类语音的微妙变化,包括音量、语速和语调。目前,Tacotron2的技术壁垒是无法实时生成语音且存在复杂单词无法正确发音的问题。随着AIGC的发展势头逐渐强劲,越来越多的音频生成大模型也应运而生。OpenAI于2022年发布的一款语音预训练大模型Whisper,集成了多语种自动语音识别(Automatic Speech Recognition,ASR)、语音翻译、语种识别功能。谷歌于2023年发布的AudioPaLM是一个支持语音理解和生成的大语言模型。该模型融合了基于文本的大语言模型PaLM 2和基于语音的大语言模型AudioLM,不仅能处理文本,还能处理音频,实现了多模态处理。

国内主流的音频生成模型包括百度的DeepVoice3、浙江大学与北京大学联合火山语音制作的Make-An-Audio及科大讯飞的SMART-TTS。DeepVoice3是基于全卷积架构的语音系统,通过完全并行计算的方式,将各种文本特征转换为声码器参数,并将其作为波形合成模型的输入来生成语音。DeepVoice3只需半小时就可以学习2500种声音,与Tacotron2功能相似,可模拟多人对话场景,但训练时对图形处理器(Graphics Processing Unit,GPU)的利用率是Tacotron2的10倍。文本到音频的生成系统Make-An-Audio可以将自然语言描述(如文字、音频、视频、图像等)作为输入,输出符合描述的音频。为解决音频到自然语言对数据稀少的客观问题,Make-An-Audio提出了创新性的Distill-then-Reprogram文本增强策略。尽管如此,由于现阶段数据来源及样本质量的问题,Make-An-Audio有时会生成不符合文字内容的音频。SMART-TTS通过文本和语音的无监督预训练,实现了从文本到声学特征,再到语音的端到端建模。只需要输入文本,SMART-TTS即可完成虚拟主播音频、视频内容的输出,支持10多种场景,支持情感调节及语音语义驱动,在技术上实现了更加逼真的语音合成效果。国内音频大模型近几年的发展也愈加迅速,LinkSoul.AI和零一万物于2023年发布的大模型LLaSM是一个支持中英双语、从语音到文本的多模态开源对话模型。LLaSM是经过端到端训练的大型多模态语言模型,具有跨模态对话能力,能够遵循语言指令。阿里巴巴通义实验室于2025年7月开源了旗下首个音频生成模型ThinkSound,该模型首次将思维链(Chain-of-Thought,CoT)应用到音频生成领域,让人工智能可以像专业音效师一样逐步思考,捕捉视觉细节,生成与画面同步的高保真音频。

5.代码生成领域

在代码生成方面,AIGC可以根据自然语言描述的非规格化需求生成代码,并进行实时纠错,还可根据正在编辑的代码上下文为开发者提供代码建议。AIGC代码生成技术可大幅提高生产效率,但仍然需要开发人员进行人工审核和修正,以确保生成的代码符合实际需求和质量标准。代码生成模型的架构主要包括左到右语言模型架构、编解码语言模型架构和掩码语言模型(Masked Language Model,MLM)架构。GPT系列采用左到右语言模型架构,典型代表有CodeParrot、Codex、PolyCoder。DeepMind推出的AlphaCode采用编解码语言模型架构,而BERT模型采用MLM架构。目前的代码大模型是使用与自然语言大模型相同的架构来实现的,但自然语言和程序设计语言之间的差别较大,容易导致层次结构不清晰、语义不严谨等问题。因此,设计更加符合程序设计语言语法和静态语义的新型代码生成模型将是未来发展的趋势。国内代码生成模型的知名度和成熟度较低、用户较少,华为等公司有部分产品测试成绩较好并能较好地支撑中文。

国外主流的代码生成模型包括DeepMind的AlphaCode、GitHub,以及与GitHub与OpenAI联合推出的代码自动生成器GitHub Copilot X。AlphaCode基于编解码语言模型架构,采用了异构与非对称结构,模型的预训练基于12种程序设计语言进行。为了解决预训练语言模型直接输出代码的质量问题,AlphaCode设计并采用了后处理的策略进行筛选和过滤,以实现从百万级代码中筛选出正确代码。但AlphaCode仍会存在生成代码错误的情况,预训练语言模型直接输出代码的质量还需迭代提高。GitHub Copilot X是一款人工智能编程类开发工具,能够实现代码补全、代码建议、代码测试、代码重构、生成代码文档等功能,基于GPT-4模型架构,可帮助开发者提升约55%的开发速度。

国内主流的代码生成模型包括清华大学的CodeGeeX、华为的PanGu-Coder。CodeGeeX是基于Transformer架构的大规模预训练编程语言模型,和GPT系列一样,采用从左到右生成的自回归解码器,含有40个Transformer层,每层的自注意力块的隐藏层维数为5120,前馈层维数为20 480,总参数量为130亿,模型支持的最大序列长度为2048。Code CeeX的训练基于华为Mindspore 1.7框架,使用了1536个昇腾910人工智能处理器,整体性能与Salesforce团队的CodeGen相当。函数级的代码生成模型PanGu-Coder是华为诺亚方舟语音语义实验室联合华为云PaaS技术创新实验室基于PanGu-Alpha研制的最新模型。PanGu-Coder训练将自回归Transformer架构用于代码生成任务,将专门为生成代码而设计的Code-CLM作为损失函数。在训练过程中,Code-CLM仅保留代码部分的损失函数计算结果,忽略自然语言部分的损失函数,在专注学习生成代码序列的同时减少了自然语言序列带来的干扰,使得PanGu-Coder第二阶段的训练数据与训练目标都更接近代码生成任务的真实场景。PanGu-Coder已集成到了华为云的代码开发辅助工具中,可以在集成开发环境(Integrated Development Environment,IDE)插件中使用自然语言描述生成函数级的 Python 代码,或根据上下文央行自动补全。

三、全球头部大模型发展概况

全球头部大模型发展迅速,技术架构多以Transformer为基础,训练算力需求量巨大,语料来源多样,部分模型开源。在全球头部大模型中,以ChatGPT、文心一言为代表的通用大模型具有很强的泛化能力,在文本、图像、音频、视频等领域均有优异表现。以下是对全球头部大模型总体情况的分析结果。

1.国家分布

美国在大模型领域处于领先地位,有多家科技公司和研究机构在开发和研究各类大模型,如OpenAI的GPT系列、谷歌的PaLM、DeepMind的Gato、Meta的LLaMA系列等。

中国在大模型领域取得了显著进展,百度的文心一言、阿里巴巴的通义千问、深度求索的DeepSeek、字节跳动的豆包、腾讯的混元等都是知名的大模型。

加拿大和俄罗斯等欧洲国家也有研究机构和公司在大模型领域进行研究和开发,代表性大模型有俄罗斯的YaLM和GigaChat等。

2.亮点技术

Transformer架构:大多数现代大模型基于Transformer架构,它通过自注意力机制来捕捉输入序列中的长距离依赖关系。

GPT系列模型:GPT系列模型通过预训练和微调的方式,学习LLM,能够生成连贯的文本。

BERT模型:BERT模型通过MLM的方式进行预训练,用于理解文本。

3.训练所用算力情况

大模型的训练通常需要大量的计算资源,包括高性能的GPU和张量处理单元(Tensor Processing Unit,TPU)集群等。GPT-3有1750亿个参数,训练过程中会消耗大量的计算资源。

训练大模型的成本非常高,只有大型科技公司和研究机构才能承担。

4.语料情况

大模型的训练需要大量的文本数据,这些数据通常来自互联网、公开数据集、书籍、学术论文等。

数据的多样性和质量对模型的性能有重要影响。因此,开发者会通过各种方法清洗和筛选数据,以提高模型的泛化能力。

5.开源情况

有些大模型是开源的,如Meta的LLaMA系列、Hugging Face的Transformers库中的一些模型。开源促进了大模型研究和应用的快速发展,然而,并非所有大模型都是开源的,一些公司为了保护自身的技术优势和商业利益,选择不公开其模型的源代码。

四、国内大模型分析

国内大模型的发展正处于一个关键时期,技术的不断进步和应用的不断拓展预示着大模型将在未来的人工智能领域扮演更加重要的角色。同时,随着技术的成熟,大模型也将面临更多的伦理和社会挑战,需要行业内外共同努力,确保技术的健康发展。

(一)国内大模型发展现状及挑战

1. 技术进步迅速

在算力方面,近1/2的国内大模型选择了华为自研的昇腾系列AI处理器,昇腾系列AI处理器已原生孵化和适配广义线性模型(Generalized Linear Model,GLM)、LLaMA、GPT等30多个基础大模型,在多个行业场景中实现了大模型应用落地。

在模型方面,百度的文心一言、阿里巴巴的通义千问等在NLP领域取得了显著成就。这些模型在文本理解、生成、对话系统等方面表现出色,这得益于深度学习算法的优化、大规模数据集的构建及高性能计算资源的投入。例如,百度的飞桨平台为大模型提供了强大的技术支持。

2.应用场景多样化

大模型的应用已经从简单的文本处理扩展到医疗、教育、金融等多个领域。在医疗领域,大模型可以辅助医生进行疾病诊断和治疗方案的制定;在教育领域,大模型可以提供个性化学习推荐;在金融领域,大模型可以用于风险评估和量化交易策略的优化。

3.开源与商业化并行

在开源方面,一些大模型(如文心一言)通过API服务形式开放,促进了技术的共享和创新。在商业化方面,企业通过将大模型集成到产品和服务中,实现商业价值的转化。

4.政策支持与市场需求

国家政策的扶持为大模型的研究和应用提供了良好的环境。例如,国家新一代人工智能开放创新平台的建立,为大模型的研究提供了资源支持。

随着数字化转型的推进,企业对智能化解决方案的需求不断增长,这都为大模型的应用提供了广阔的市场空间。

5.国际竞争与合作

国内的大模型在国际竞争中逐渐崭露头角,但仍需面对如GPT系列等模型的挑战。

同时,国内外企业在大模型领域的合作日益增多,通过技术交流和资源共享,共同推动大模型技术的发展。

6.数据安全与伦理问题

在数据安全方面,大模型的训练和应用需要处理大量敏感数据,如何确保数据隐私和安全成为重要议题。在伦理问题方面,大模型可能存在偏见和歧视,如何确保模型的公平性和透明度,避免对社会造成负面影响,是亟待解决的问题。

7.技术挑战与未来展望

技术挑战包括模型的可解释性、泛化能力、计算效率等。例如,如何让模型的决策过程更加透明?如何在保持模型性能的同时降低计算成本?

随着算法的不断优化和计算资源的增强,国内大模型有望在更多领域(如自动驾驶、智能制造等)实现突破,为社会带来更多创新和便利。

(二)国内大模型备案情况

1.大模型备案情况

截至2025年6月18日,我国已经有433款大模型完成备案并上线提供服务,形成了比较连续和稳定的节奏[1]。《生成式人工智能服务管理暂行办法》是我国对生成式人工智能实行监管的专门法规,于2023年8月施行。未来,对人工智能大模型的监管将坚持宽松鼓励和整顿规范并重,面向广大社会公众提供服务。大模型备案主要分为四个阶段:一是企业自我评估,大模型服务提供者应依据现行法律法规及备案要求,开展自我评估,全面核查模型的合规性与安全性,据此整理并编制备案申请文件;二是属地网信部门初审,企业将备案材料提交至属地网信部门,属地网信部门对提交材料进行审查,形成初审意见;三是国家网信部门终审,通过初审的备案材料将报送至国家互联网信息办公室(简称国家网信办),国家网信办对报送材料进行审查;四是备案公示与服务上线,审查通过后,网信部门将向备案大模型授予备案编号,并在官网公示,备案大模型即可上线提供服务。

[1] 数据来源:央广网。

2.算法备案情况

除了大模型,获批的机构还需要对设计生成式人工智能技术的算法进行备案。算法备案是我国近年来对互联网信息服务算法进行的一项重要监管措施,旨在加强对算法推荐、深度合成、生成式人工智能等新技术应用的规范管理。《互联网信息服务深度合成管理规定》第十九条明确规定:“具有舆论属性或者社会动员能力的深度合成服务提供者,应当按照《互联网信息服务算法推荐管理规定》履行备案和变更、注销备案手续。”

2023年6月20日,国家网信办发布《境内深度合成服务算法备案清单》,百度、阿里巴巴、腾讯、抖音、科大讯飞等科技巨头的41款算法入选,这也是国内首批公开的算法备案清单。

2023年9月1日,国家网信办发布的《关于第二批深度合成服务算法备案的信息公告》显示,共有110款算法完成备案,涵盖虚拟人或3D数字人合成、影音图文合成及生成、智能客服、智能对话等领域。

2024年1月5日,国家网信办发布《关于第三批深度合成服务算法备案的信息公告》,淘宝对话生成算法、医联MedGPT生成算法,中国电信数字人生成算法、网易智能商品内容生成算法等129款算法完成备案。

2024年2月18日,国家网信办发布《关于第四批深度合成服务算法备案的信息公告》,共有266款算法完成备案。

截至2025年9月,国家网信办已发布十三批深度合成服务算法备案信息,共有586款算法完成备案。

相关图书

SDD实战:规范驱动开发之道
SDD实战:规范驱动开发之道
Agent Skills开发实战像搭积木一样构建智能体
Agent Skills开发实战像搭积木一样构建智能体
Agent设计模式 图解可复用智能体架构
Agent设计模式 图解可复用智能体架构
Codex快速入门:Harness工程落地
Codex快速入门:Harness工程落地
构建之法——现代软件工程(第四版)
构建之法——现代软件工程(第四版)
AI科研绘图:Nano Banana极速实战指南
AI科研绘图:Nano Banana极速实战指南

相关文章

相关课程