第一部分 决定书原文
扉页
| 无效宣告请求人 | 深圳市趣推科技有限公司 | 专利权人 | 南京硅基智能科技集团股份有限公司 |
| 专利号 | 202410022841.6 | 申请日 | 2024年01月08日 |
| 优先权日 | — | 授权公告日 | 2024年05月07日 |
| 无效宣告请求日 | 2024年08月01日 | 法律依据 | 专利法第22条第3款 |
| 审查结论 | 维持专利权有效 | | — |
决定要点
决定要点涉及人工智能应用的技术方案通常包括模型设计、模型训练、模型应用三个阶段。面对涉及 人工智能应用的权利要求时,应站位本领域技术人员,从处理目的、处理对象、处理结果、结果 使用等方面准确理解权利要求的技术术语,确定权利要求记载的技术手段的所处阶段,进而准确 地判断本专利和现有技术记载的技术方案的异同。 模型训练阶段是涉及人工智能应用的技术方案中特定而重要的部分。如果涉及人工智能应用 的权利要求的技术方案与最接近的现有技术虽用于相同的场景但采用了不同的模型训练方法,现 有技术整体上未给出改进模型训练方法的启示,且上述不同的模型训练方法使得该权利要求的技 术方案相对于现有技术获得了诸如模型输出结果更精确或模型训练成本更低的有益的技术效果, 则权利要求的技术方案具备创造性。
一、案由
本专利的专利号为202410022841.6,申请日为2024年01月08日,授权公告日为2024年05月07日。本专利授权公告时的权利要求书如下:
“1.一种基于音频生成动态图像的方法,其特征在于,包括:
获取用户输入的参考图像和参考音频;
基于所述参考图像和训练后的生成网络模型,确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;
基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;
基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像;所述待处理图像与所述参考图像中的图像对象相同;所述目标生成网络模型用于基于输入的所述参考音频和所述参考图像得到目标驱动特征,并基于所述目标驱动特征对输入的所述待处理图像中的目标区域进行驱动以输出所述目标动态图像。
2.根据权利要求1所述的方法,其特征在于,所述基于所述参考图像和训练后的生成网络模型,确定目标头部动作特征和目标表情系数特征,包括:
基于所述参考图像生成的预设时长的视频以得到参考数据;所述参考数据通过对基于参考图像进行处理得到;
通过所述训练后的生成网络模型从所述参考数据中提取所述目标头部动作特征和所述目标表情系数特征。
3.根据权利要求2所述的方法,其特征在于,所述通过所述训练后的生成网络模型从所述参考数据中提取所述目标头部动作特征和所述目标表情系数特征,包括:
通过所述训练后的生成网络模型从所述参考数据中确定多帧目标人物的面部图像;
通过所述训练后的生成网络模型基于各帧所述目标人物的面部图像进行特征提取,得到所述目标头部动作特征和所述目标表情系数特征。
4.根据权利要求1所述的方法,其特征在于,所述目标生成网络模型包括仿射子网络和驱动子网络;
所述基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像,包括:
通过所述仿射子网络对所述待处理图像进行处理,得到待处理特征图,并通过所述仿射子网络基于所述参考音频、所述参考图像和所述待处理特征图,得到形变特征图;所述仿射子网络用于确定所述参考音频对应的目标梅尔倒谱系数特征,对所述参考图像进行特征提取得到参考特征图,以及对所述参考特征图进行仿射变换得到所述形变特征图;
通过所述驱动子网络基于所述形变特征图,对所述待处理图像进行处理,得到所述目标动态图像;所述驱动子网络用于对所述待处理图像进行驱动处理,得到所述目标动态图像。
5.根据权利要求4所述的方法,其特征在于,所述仿射子网络包括语音处理层、特征提取层、特征融合层和特征仿射层;
所述通过所述仿射子网络对所述待处理图像进行处理,得到待处理特征图,并通过所述仿射子网络基于所述参考音频、所述参考图像和所述待处理特征图,得到形变特征图,包括:
通过所述语音处理层确定所述参考音频对应的目标梅尔倒谱系数特征;
通过所述特征提取层对所述参考图像进行特征提取,得到参考特征图;
通过所述特征提取层对所述待处理图像进行特征提取,得到待处理特征图;
通过所述特征融合层对所述参考特征图和所述待处理特征图进行特征堆叠对齐处理,得到融合特征图;
通过所述特征仿射层基于所述融合特征图和所述目标梅尔倒谱系数特征确定仿射系数,并基于所述仿射系数对所述参考特征图进行仿射变换的空间形变,得到所述形变特征图。
6.根据权利要求5所述的方法,其特征在于,所述驱动子网络包括特征处理层、特征同步层和图像驱动层;
所述通过所述驱动子网络基于所述形变特征图,对所述待处理图像进行处理,得到所述目标动态图像,
包括:
通过所述特征处理层基于所述目标梅尔倒谱系数特征,得到初始驱动特征;
通过所述图像驱动层基于所述初始驱动特征对所述待处理特征图进行驱动处理,得到初始特征图;
通过所述特征同步层对所述形变特征图与所述初始特征图进行堆叠处理,以确定所述形变特征图与所述初始特征图之间的特征同步参数;
通过所述特征处理层基于所述特征同步参数对所述初始驱动特征进行调整,得到目标驱动特征;
通过所述图像驱动层基于所述目标驱动特征,对所述待处理图像进行驱动处理,得到所述目标动态图像。
7.根据权利要求1-6任一项所述的方法,其特征在于,所述方法还包括:
获取样本视频;其中,所述样本视频中的视频对象与所述待处理图像中的图像对象不同;
通过待训练的生成网络模型对所述样本视频进行处理,提取样本音频数据和样本图像数据;
基于所述待训练的生成网络模型对所述样本音频数据和所述样本图像数据进行处理,得到预测训练结果;
以所述预测训练结果作为所述待训练的生成网络模型的初始训练输出,所述样本图像数据作为监督信息,
迭代训练所述待训练的生成网络模型得到所述训练后的生成网络模型。
8.根据权利要求7所述的方法,其特征在于,所述基于所述待训练的生成网络模型对所述样本音频数据和所述样本图像数据进行处理,得到预测训练结果,包括:
基于所述待训练的生成网络模型从所述样本音频数据中提取参考梅尔倒谱系数特征;
基于所述待训练的生成网络模型从所述样本图像数据中提取参考头部动作、参考表情系数特征和参考人脸特征;
通过所述待训练的生成网络模型基于所述参考梅尔倒谱系数特征、所述参考头部动作、所述参考表情系数特征和所述参考人脸特征,得到所述预测训练结果。
9.根据权利要求7所述的方法,其特征在于,所述以所述预测训练结果作为所述待训练的生成网络模型的初始训练输出,所述样本图像数据作为监督信息,迭代训练所述待训练的生成网络模型得到所述训练后的生成网络模型,包括:
根据所述预测训练结果和所述样本图像数据,确定损失值;
根据所述损失值,迭代更新所述待训练的生成网络模型,得到所述训练后的生成网络模型。
10.一种基于音频生成动态图像的装置,其特征在于,包括:
获取模块,用于获取用户输入的参考图像和参考音频;
处理模块,用于基于所述参考图像和训练后的生成网络模型,确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;
调整模块,用于基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;
所述处理模块,还用于基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像;所述待处理图像与所述参考图像中的图像对象相同;所述目标生成网络模型用于基于输入的所述参考音频和所述参考图像得到目标驱动特征,并基于所述目标驱动特征对输入的所述待处理图像中的目标区域进行驱动以输出所述目标动态图像。
11.一种电子设备,包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序,
其特征在于,所述处理器执行所述程序时实现如权利要求1-9任一项所述的方法的步骤。
12.一种非暂态计算机可读存储介质,其上存储有计算机程序,其特征在于,所述计算机程序被处理器执行时实现如权利要求1-9任一项所述的方法的步骤。”请求人于2024年08月01日向国家知识产权局提出了无效宣告请求,其理由是权利要求1-12不符合专利法第22条第3款有关创造性的规定,请求宣告本专利权利要求1-12全部无效,同时提交了如下证据:
证据 1:CSDN 博客网页,胖胖腐乳,“SadTalker Learning Realistic 3D Motion Coefficients for StylizedAudio-Driven Single Image Talking”,https://blog.csdn.net/weixin_41967328/article/details/129517368,发布日为2023年03月14日,及其中文译文;
证据2:CSDN博客网页,Redflashing,“[读论文]弱监督学习的精确3D人脸重建:从单个图像到图像集-Accurate 3D Face Reconstruction with Weakly-Supervised Learning:From Single Image to Image Set”,
https://blog.csdn.net/weixin_42363722/article/details/120254880,发布日为2021年09月12日,及其中文译文;
证据3:申请公布号为CN115131849A的中国发明专利申请,申请公布日为2022年09月30日;
证据4:申请公布号为CN117315157A的中国发明专利申请,申请公布日为2023年12月29日;
证据5:申请公布号为CN116912639A的中国发明专利申请,申请公布日为2023年10月20日;
证据6:申请公布号为CN116844215A的中国发明专利申请,申请公布日为2023年10月03日;
证据7:申请公布号为CN115035604A的中国发明专利申请,申请公布日为2022年09月09日。
请求人主张:(1)以证据1作为最接近的现有技术,权利要求1、10相对于证据1和证据2的结合,或证据1和公知常识的结合不具备创造性;权利要求2-3相对于证据1、证据2和证据7的结合,或证据1和公知常识的结合不具备创造性;权利要求4-9相对于证据1、证据2、证据6、证据7和公知常识的结合,或证据1、证据6和公知常识的结合不具备创造性;基于对权利要求1-9的引用关系,权利要求11-12相对于相应证据组合也不具备创造性;(2)以证据3作为最接近的现有技术,权利要求1-3、10相对于证据3和证据4的结合,或证据3的各个实施例结合不具备创造性;权利要求4-9相对于证据3、证据4、证据6和公知常识的结合,或证据3、证据6和公知常识的结合不具备创造性;基于对权利要求1-9的引用关系,权利要求11-12相对于相应证据组合也不具备创造性;(2)以证据5作为最接近的现有技术,权利要求1相对于证据5不具备创造性;权利要求2相对于证据5和公知常识的结合不具备创造性。
经形式审查合格,国家知识产权局于2024年08月12日受理了上述无效宣告请求并将无效宣告请求书及证据副本转给了专利权人,同时成立合议组对本案进行审查。
国家知识产权局本案合议组于2024年10月17日向双方当事人发出了口头审理通知书,定于2024年12月20日举行口头审理,
专利权人针对上述无效宣告请求于2024年12月18日提交了意见陈述书,并认为请求人的证据均不涉及本专利权利要求1中的模型微调过程,请求人的无效理由均不成立。
本案合议组于2024年12月19日将上述意见陈述书转送给请求人。
口头审理如期举行,双方当事人均委托代理人出席了本次口头审理。在口头审理过程中,双方当事人对对方出庭人员的身份无异议,对合议组成员变更无异议,对合议组成员和书记员无回避请求,并明确了以下事项:
(1)请求人明确其无效理由、证据和范围以请求书为准;涉及权利要求1的创造性最主要的结合方式为证据1结合证据2;权利要求1相对于证据5的多个实施例结合不具备创造性的理由并不涉及公知常识;
(2)专利权人对请求人提交的证据1-7的真实性、公开日期无异议,对证据1、证据2的中文译文的准确性无异议;并明确其于2024年12月18日提交的意见陈述仅供合议组参考;
(3)双方当事人已经充分陈述了意见,口头审理之后合议组不再接受双方当事人的意见陈述。
至此,合议组认为本案事实已经清楚,可以作出审查决定。
二、决定的理由
(一)审查基础本无效宣告请求决定的审查基础为本专利的授权公告文本。
(二)证据认定证据1和证据2为CSDN网站的博客网页,证据3-证据7为中国专利文献,专利权人对请求人提交的证据1-7的真实性、公开日期无异议,对证据1、证据2的中文译文的准确性无异议;合议组亦未发现影响证据1-7的真实性的明显瑕疵,因此对证据1-7的真实性、公开日期予以确认。证据1-7的公开日期均在本专利的申请日之前,属于可以用于评述本专利是否符合专利法第22条第3款规定的创造性的现有技术。证据1、证据2的中文译文以请求人提交的中文译文为准。
(三)关于权利要求技术方案的理解涉及人工智能应用的技术方案通常包括模型设计、模型训练、模型应用三个阶段。面对涉及人工智能应用的权利要求时,应站位本领域技术人员,从处理目的、处理对象、处理结果、结果使用等方面准确理解权利要求的技术术语,确定权利要求记载的技术手段的所处阶段,进而准确地判断本专利和现有技术记载的技术方案的异同。
权利要求1要求保护(1-1)一种基于音频生成动态图像的方法,其特征在于,包括:
(1-2)获取用户输入的参考图像和参考音频;
(1-3)基于所述参考图像和训练后的生成网络模型,确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;
(1-4)基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;
(1-5)基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像;
所述待处理图像与所述参考图像中的图像对象相同;所述目标生成网络模型用于基于输入的所述参考音频和所述参考图像得到目标驱动特征,并基于所述目标驱动特征对输入的所述待处理图像中的目标区域进行驱动以输出所述目标动态图像。
根据本专利权利要求1结合说明书第[0004]段的记载,权利要求1的技术方案是基于目标人物的单张图片和音频数据并利用神经网络模型得到目标人物的动态图像,具体技术手段包括权利要求1中的特征(1-1)至(1-5),其中特征(1-3)描述了训练后的生成网络模型的处理对象为用户输入的参考图像,以及模型生成的结果为目标头部动作特征和目标表情系数特征,特征(1-4)描述了利用特征(1-3)生成的结果对生成网络模型进行调整;可见特征(1-3)-(1-4)描述的是对神经网络模型进行调整的过程,其属于神经网络模型的模型训练阶段。特征(1-5)描述了神经网络模型的处理对象为参考音频和参考图像以及待处理图像,模型的生成结果为目标动态图像,该生成的结果即为目标对象的动态图像,属于模型应用阶段。
(四)关于专利法第22条第3款专利法第22条第3款规定:创造性,是指与现有技术相比,该发明具有突出的实质性特点和显著的进步,
该实用新型具有实质性特点和进步。
模型训练阶段是涉及人工智能应用的技术方案中特定而重要的部分。如果涉及人工智能应用的权利要求的技术方案与最接近的现有技术虽用于相同的场景但采用了不同的模型训练方法,现有技术整体上未给出改进模型训练方法的启示,且上述不同的模型训练方法使得该权利要求的技术方案相对于现有技术获得了诸如模型输出结果更精确或模型训练成本更低的有益的技术效果,则权利要求的技术方案具备创造性。
(4.1)关于权利要求1(4.1.1)以证据1作为最接近的现有技术证据1(参见证据1中文译文第1节-第4节及图1-8):公开了一种通过隐式三维系数调制的程式化音频驱动的说话头视频生成系统,称为“SadTalker”(相当于本专利“一种基于音频生成动态图像的方法”,
即公开了权利要求1的特征(1-1)),具体如下:如图2所示,我们的系统使用三维运动系数作为说话头生成的中间表示。我们首先从原始图像(相当于本专利 “获取用户输入的参考图像”)中提取系数。然后利用ExpNet和PoseVAE分别生成逼真的3DMM运动系数。最后,提出了一种3d感知的面部渲染来生成说话头部视频。下面,我们将在第3.1节中简要介绍3D人脸模型,分别在第3.2节和第3.3节中设计音频驱动的运动系数生成和系数驱动的图像动画器。(如图2所示,输入音频相当于本专利的“参考音频”)3.1三维人脸模型的初步研究受最近的单幅图像深度三维重建方法[4]的启发,我们将预测的三维变形模型(3DMMs)的空间作为我们的中间表示。在3DMM中,三维面形S可以解耦为:
S=S+αU +βU ,
id exp其中S为3D人脸的平均形状,U 和U 为LSFM的变形模型[1]的身份和表达的标准正交基。系数α∈ℝ80id exp和β∈ℝ64分别描述了人的身份和表达,为了保持位姿方差,r∈SO(3)和t∈ℝ3表示头部旋转和平移。为了实现同一性无关系数生成[31],我们只对运动参数建模为{β, r, t}。我们从前面介绍的驾驶音频中分别学习了头部姿势ρ=[r, t]和表达系数β。然后,这些运动系数用于隐式调节我们的面部渲染,以实现最终的视频合成。
3.2通过音频生成运动系数如上所述,3D运动系数包含头部姿态和表情,其中头部姿态是全局运动,而表情是相对局部的。因为头部的姿势与音频的关系较弱,而嘴唇的运动是高度相关。我们使用提出的PoseVAE和ExpNet生成头部姿态和表情的运动(相当于本专利的“目标驱动特征”),分别介绍如下。
对于身份问题,我们通过第一帧的表达系数β 将表情运动与特定的人联系起来。为了减少自然说话中其0他面部成分的运动权重,我们通过Wav2Lip[28]预训练网络和深度三维重建[4],只使用嘴唇运动系数作为系数目标。然后,其他微小的面部动作(例如眨眼)可以通过渲染图像上的额外地标损失来利用。
图3。我们的ExpNet结构。我们采用单目三维人脸重建模型[4](R 和R )来学习真实表情系数。其中Re d e是预训练的3DMM系数估计器,R 是没有可学习参数的可微分3D人脸渲染。我们使用参考表达式β 为来d 0降低身份的不确定性,并使用预训练的Wav2Lip[28]生成的帧和第一帧作为目标表达系数,因为它只包含与嘴唇相关的运动。
图4。PoseVAE管道。我们通过条件VAE结构学习输入头位ρ 的残差。给定条件:第一帧ρ ,样式标识0 0Z 和音频剪辑α{1,...,t}时,我们的方法学习了残差头位姿Δρ{1,...,t}=ρ{1,...,t}−ρ 。训练之后,我们可以只style 0通过姿态解码器和条件(cond.)生成程式化的结果。
如图4所示,我们设计了一个基于VAE[20]的模型来学习真实说话视频中真实的、身份感知的程式化头部运动ρ∈ℝ6。在训练中,姿态VAE使用基于编码器的结构在固定n帧上进行训练。编码器和解码器都是两层MLP,其中输入包含一个连续的t帧头姿态,我们将其嵌入到高斯分布中。在解码器中,学习网络从采样分布中生成t帧姿态。我们的PoseVAE不是直接生成姿态,而是学习第一帧的条件姿态ρ 的残差,这使得我0们的方法能够在第一帧条件下生成更长的、稳定的、连续的头部运动。另外,根据CVAE[5],我们添加相应的音频特征α{1,...,t}和风格认同Ζ 作为节奏意识和风格认同的条件。采用kl-散度ℒ 测量所产生运动的style KL分布。采用均方损耗ℒ 和对抗损耗ℒ 来保证生成的质量。我们在补充材料中提供了更详细的损失函数。
MSE GAN3.3 3d感知面部渲染图5。提出的FaceRender及与facevid2vid[40]的比较。给定源图像Is和驱动图像I ,facevid2vid在无监督d的三维关键点空间Χ
c
、Χ
s和Χ
d中生成运动。然后通过外观A0的关键点生成图像。在生成逼真的3D运动系数后,我们通过一个设计良好的3D感知图像动画器渲染最终的视频。(相当于本专利的“所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像”)。
4 实验4.1实现细节和度量数据集。我们使用V oxCeleb[25]数据集进行训练,其中包含1251个受试者的超过100k个视频。我们按照前面的图像动画方法[34]裁剪原始视频,并将视频大小调整为256×256。预处理后,数据用于训练我们的FaceRender。由于一些视频和音频在V oxCeleb中没有对齐,我们选择了46个科目的1890个对齐的视频和音频来训练我们的PoseVAE和ExpNet。输入音频被降采样到16kHz,并转换为与Wav2lip[28]设置相同的mel-
频谱图。为了测试我们的方法,我们使用了来自HDTF数据集[46]的346个视频的前8秒视频(总共约70k帧),因为它包含高分辨率和野外说话的头部视频。这些视频也按照[34]进行裁剪和处理,并将大小调整为256
×256以供评估。我们使用每个视频的第一帧作为参考图像来生成视频。
实现细节。ExpNet,PoseVAE和FaceRender都是单独训练的,我们使用Adam优化器[19]进行所有实验。
经过训练后,我们的方法可以在没有任何人工干预的情况下以端到端方式进行推断。通过预训练的深度三维人脸重建方法[4]提取所有的3DMM参数。所有实验均在8个A100图形处理器上进行。ExpNet、PoseV AE和FaceRender的学习速率分别为2e5、1e4和2e4。从时间上考虑,ExpNet使用连续5帧进行学习。
PoseVAE是通过连续32帧学习的。FaceRender中的帧是逐帧生成的,为了稳定,系数为5连续帧。
4.2 与其他最先进的方法进行比较图6,我们将我们的方法与几种最先进的方法进行比较,用于生成单个图像音频驱动的说话头。我们的方法在嘴唇同步、身份保留、头部运动和图像质量方面产生了更高质量的结果。
根据证据1的上述记载可知,证据1图2显示了其为了实现通过人脸图像和一段语音音频生成会说话的头部视频的发明而设计的神经网络模型架构,第3节详细描述了SadTalker模型架构,具体的各个模块的架构如图3-5所示,属于模型设计阶段;第4.1节描述了SadTalker模型的训练过程,该SadTalker的输入数据为来自HDFT数据集第346个视频的前8秒视频中处理的图像的音频来生成视频,并根据评价指标评估完成了模型的训练,可见其处理对象为样本集视频,根据评价指标完成模型训练,属于模型训练阶段;第4.2节描述了模型应用后的效果展示以及与其它模型的比较内容,属于模型应用阶段。即第4.1节训练后的SadTalker模型相当于本专利权利要求1的“训练后的生成网络模型”,第4.2节使用训练后的SadTalker模型根据用户输入的单图像和输入的参考音频生成视频,最终生成的视频相当于本专利权利要求1的“目标动态图像;所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像”。证据1中第4.1节利用样本集数据训练完成SadTalker模型后即可直接根据输入图像和音频生成视频,其方法中并不涉及对训练后的SadTalker模型再进行模型调整的内容;而本专利权利要求1首先有训练后的生成网络模型,然后再利用用户输入的图像作为参考图像对训练后的生成网络模型再进行调整,并且这次对于模型的调整是基于输入的参考图像,该参考图像的对象与待处理图像的对象相同,并不涉及音频内容,以及本专利权利要求1还记载了具体的模型调整手段。由此可知,本专利权利要求1与证据1对于模型的训练方法是不同的。
可见,本专利权利要求1与证据1的区别技术特征在于:基于所述参考图像和训练后的生成网络模型,
确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述待处理图像与所述参考图像中的图像对象相同。基于上述区别技术特征可以确定权利要求1实际解决的技术问题是如何使得模型生成的对象更贴近待处理图像中对象。
证据2公开了(参见证据2中文译文第1节-第4节及图1-3)一种基于CNN的单图像人脸重建方法。
具体如下:
图1.(a)方法框架:包括一个用于端到端单图像三维重建的重建网络和一个用于基于多图像重建的置信度测量子网。在本文中,作者使用ResNet-50网络,通过将最后一个全连接层修改为239个神经元,来回归这些系数。为了简洁起见,作者把这个用于单幅图像重建的修改后的ResNet-50网络称为R-Net。作者将在下一节中介绍如何训练它。
4用于单幅图像重建的混合弱监督学习给定一个训练RGB图像I,作者使用R-Net回归系数向量x,利用它可以通过一些简单的、可微的数学推导分析生成重建的图像I’。R-Net是在没有任何真实标签的情况下进行训练的,但通过评估I’的混合损失,并对其进行反向传播。具体的损失函数和正则化手段参见4.1-4.3。其中4.1.2标记点损失:作者还使用二维图像上的人脸标记点作为弱监督来训练网络。作者使用目前最准确的三维人脸对齐方法来检测训练图像的68个标记点{q }。在训练中,作者将重建的形状的三维标记顶点投射到图像上,得到{q'},并通过相应的n n公式计算出损失。
根据证据2的上述记载可知,R-Net输入的对象是单幅图像,输出的结果是包括身份系数等五个系数,
通过上述输出的系数进行3D重建与图像渲染,即可得到对应的3D人脸。证据2的目的在于提出新的混合损失计算方法,可以通过上述损失计算方法对R-Net训练过程的生成结果进行验证,并反向传播,最终获得更加准确的能够处理图像的神经网络模型,可见证据2的R-Net模型是用于基于单幅图像生成3D人脸重建所需的中间系数,其通过训练获得了对单幅图像进行处理生成系数的符合损失函数标准的模型,然后利用该训练后的模型输出系数实现3D人脸的重建,即证据2仅公开了一种用于单幅图像的神经网络模型的训练过程,
训练完成后直接应用于图像推理,其虽然属于模型训练阶段,但是其模型训练阶段并不存在对训练后的的模型再进行调整的内容,没有给出要在训练后的神经网络模型应用过程中利用具有相同对象的参考图像对训练后的神经网络模型进行调整的启示。正是采用了上述区别技术特征,权利要求1获得了生成目标动态图像中的图像更贴近待处理图像中对象的有益的技术效果。因此,权利要求1相对于证据1、证据2的结合具有突出的实质性特点和显著的进步,具备专利法第22条第3款有关创造性的规定。
另外,证据1的第3节的模型实现了从输入的图像和音频生成目标动态图像的功能,这与本专利的模型目的相同,证据1的3.2中的β 是从输入图像生成的表情系数,用于将表情运动与特定的人联系起来,I 是0 0输入Wav2Lip预训练网络的数据,为嘴部训练的第一帧数据,两者与权利要求1中的基于参考图像生成的多个预测图像完全不同;而且没有证据表明上述权利要求1与证据1的区别技术特征属于本领域的公知常识,
正是采用了上述区别技术特征,权利要求1获得了生成目标动态图像中的图像更贴近待处理图像中对象的有益的技术效果。因此,权利要求1相对于证据1和公知常识的结合具有突出的实质性特点和显著的进步,具备专利法第22条第3款规定的创造性。
(4.1.2)以证据3作为最接近的现有技术证据3公开了一种图像生成方法以及相关设备。(参见说明书第76-159段及图1a-1d)如图1b所示,
该图像生成方法的具体流程可以如下:
101、获取目标对象的原始面部图像帧和待生成的目标面部图像帧对应的音频驱动信息。目标对象可以为面部姿态待调整的对象,原始面部图像帧为包含目标对象面部的图像,音频驱动信息为用于对原始面部图像帧进行面部姿态调整的音频信息,目标面部图像帧具体可以为基于音频驱动信息,对原始面部图像帧中面部姿态调整后对应的面部图像。这里所说的面部姿态具体可以指面部表情,如嘴型、眼神等对象面部信息。
102、对所述原始面部图像帧进行空间特征提取,得到所述原始面部图像帧对应的原始面部空间特征。原始面部空间特征具体可以包括原始面部图像帧对应的三维(3D,3-dimensional)面部系数,比如具体可以包括身份信息(identity),光影(lighting),纹理(texture),表情(expression),姿态(pose),眼神(gaze)等。根据这些面部系数可以重建出原始面部图像帧的面部,如图1d所示。
103、对所述音频驱动信息进行时序特征提取,得到所述目标面部图像帧对应的面部局部姿态特征。对所述音频驱动信息中的各个音频帧进行特征提取,得到各个音频帧的音频语义特征信息;基于各个音频帧的前后音频帧的音频语义特征信息,对所述各个音频帧的音频语义特征信息进行处理;将处理后的各个音频帧的音频语义特征信息进行融合,得到所述目标面部图像帧对应的面部局部姿态特征。
104、基于所述原始面部空间特征和所述面部局部姿态特征,对所述目标对象进行面部重建处理,生成所述目标面部图像帧。具体为:将所述原始面部空间特征和所述面部局部姿态特征进行融合,得到融合后面部空间特征;基于所述融合后面部空间特征,对所述目标对象进行面部重建处理,得到所述目标对象对应的参考面部图像帧;基于所述原始面部图像帧、所述融合后面部空间特征和所述参考面部图像帧,生成所述目标面部图像帧。重建后三维面部图像的纹理光影可以来自于原始面部图像帧,重建后三维面部图像的姿态表情可以音频驱动信息。
(参见说明书第160-176段及图1f)通过图像生成模型,……。需要说明的是,该图像生成模型可以由多组训练数据训练而成,该图像生成模型具体可以由其他设备进行训练后,提供给该图像生成装置,或者,
也可以由该图像生成装置自行进行训练。
若由该图像生成装置自行进行训练,则步骤“通过图像生成模型,对所述原始面部图像帧进行空间特征提取,得到所述原始面部图像帧对应的原始面部空间特征”之前,还可以包括:
获取训练数据,所述训练数据包括样本对象的原始面部图像帧样本、目标驱动面部图像帧样本、以及所述目标驱动面部图像帧样本对应的音频驱动信息样本;通过预设图像生成模型,对所述原始面部图像帧样本进行空间特征提取,得到所述原始面部图像帧样本对应的原始面部空间特征;对所述音频驱动信息样本进行时序特征提取,得到所述目标驱动面部图像帧样本对应的面部局部姿态特征;基于所述原始面部空间特征和所述面部局部姿态特征,对所述样本对象进行面部重建处理,得到预测驱动面部图像帧;基于所述目标驱动面部图像帧样本和所述预测驱动面部图像帧,对预设图像生成模型的参数进行调整,得到训练后的图像生成模型。其中,目标驱动面部图像帧样本可以视为标签信息,具体可以为音频驱动信息样本对应的期望驱动面部图像帧。
(参见说明书第235-237段及图1g)以训练后图像生成模型输出目标面部图像帧为例,通过训练后图像生成模型输出目标分辨率下的目标面部图像帧的过程可以如图1g所述。由上可知,本实施例可以获取目标对象的原始面部图像帧和待生成的目标面部图像帧对应的音频驱动信息(相当于本专利的“待处理图像和输入音频”);对所述原始面部图像帧进行空间特征提取,得到所述原始面部图像帧对应的原始面部空间特征;
对所述音频驱动信息进行时序特征提取,得到所述目标面部图像帧对应的面部局部姿态特征;基于所述原始面部空间特征和所述面部局部姿态特征,对所述目标对象进行面部重建处理,生成所述目标面部图像帧。本申请可以通过对音频驱动信息进行特征提取,捕捉到目标对象部分的面部姿态细节信息,进而基于捕捉到的信息来对原始面部图像帧进行面部调整,从而获取音频驱动信息对应的目标面部图像帧,这样有利于提高目标面部图像帧的生成效率和准确性。
根据证据3的上述记载可知,证据3的图1b及其文字描述为一种图像生成方法,说明书第160-165段记载了通过“图像生成模型”完成上述方法,公开了根据图像和音频数据生成视频的模型的具体架构,属于模型设计阶段;说明书第168-176段为对该图像生成模型的训练阶段,其处理对象为训练模型和验证模型的样本数据,最后得到训练后的图像生成模型,其属于模型训练阶段;图1g及其相关文字描述为该图像生成模型具体用于根据某原始面部图像和音频驱动信息生成目标面部图像帧的过程,其属于模型应用阶段。可见证据3的图1g训练完成后的模型相当于本专利权利要求1的“训练后的生成网络模型”,证据3直接使用训练完成后的模型根据用户输入的图像和输入的参考音频生成视频,最终生成的视频相当于本专利权利要求1的“目标动态图像,所述目标动态图像表征所述待处理图像中目标人物基于所述参考音频变化面部表情的动态图像”,用户输入的原始面部图像相当于本专利权利要求1“待处理图像”。而本专利权利要求1首先有训练后的生成网络模型,然后再利用用户输入的图像作为参考图像对训练后的生成网络模型再进行调整,并且这次对于模型的调整是基于输入的参考图像,该参考图像的对象与待处理图像的对象相同,并不涉及音频内容,
以及权利要求1还记载了具体的模型调整手段。由此可知,本专利权利要求1与证据3对于模型的训练方法是不同的。
可见,本专利权利要求1与证据3的区别技术特征在于:基于所述参考图像和训练后的生成网络模型,
确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述待处理图像与所述参考图像中的图像对象相同。基于上述区别技术特征可以确定权利要求1实际解决的技术问题是如何使得模型生成的对象更贴近待处理图像中对象。
证据4公开了一种基于单幅图像进行3D人脸重建的方法,并具体公开了:(参见说明书第4段)现有的专利都是直接使用一个神经网络同时计算出身份和表情系数,就会导致身份和表情系数存在相互耦合的问题,即不同的身份系数通过特定的表情组合,也可能能够表达出同样形状的3D人脸,这种现象就会造成现有方法重建出的人脸身份特征存在误差。(参见说明书第17-35段及图1-2)一种基于单幅图像进行3D人脸重建的方法,包括如下步骤:步骤一、使用一个现有的人脸检测器对图像进行人脸检测,然后根据人脸检测的结果计算出图像中人脸区域的包围盒,并根据包围盒对图像进行裁剪,再通过PyTorch框架中的Transform模块对图像进行归一化;步骤二、使用一个现有的人脸属性编辑模型对原图像进行编辑,包括去除表情、随机产生表情以及随机旋转,在模型示意图中,(b)部分的I 表示原图,I 表示去除表情后的图像;(c)部分的I0 1 2表示随机旋转后的图像,I 表示随机产生表情后的图像。步骤三、3D人脸重建的回归模型包括ID-Net、
3Perform-Net两个ResNet50神经网络模型,ID-Net用于输出身份系数,身份系数是一个低维向量,表示3D人脸的固有特征,与表情无关,Perform-Net用于输出表情、颜色、位姿、光照等系数;使用3DMM模型作为解码器。步骤四、使用步骤二中得到的去除表情后的图像与原图像配对,训练ID-Net和Perform-Net两个模型,损失函数包括特征点重投影损失、像素损失、人脸识别相似度损失、形状一致性损失以及正则损失;
步骤五、将ID-Net网络参数固定,使用步骤二中得到的随机表情与随机旋转的图像增强结果与原图像配对,
来对Perform-Net进一步训练调优,以增强算法针对连续视频帧表情和位姿系数提取的稳定性,损失函数包括特征点重投影损失、像素损失、位姿一致性损失、旋转一致性损失以及正则损失。(参见说明书第12段)本发明的有益效果是:本发明能够从野外图像中重建出具有身份信息的三维人脸模型,实现了三维人脸重建的高精度、高质量和高鲁棒性。将三维人脸模型的身份系数和表情系数分离,实现了三维人脸重建的身份-表情解耦,提高了重建出的三维人脸模型身份的准确性。根据证据4的上述记载可知,证据4是在单幅图像处理过程中对输入图像进行了表情去除以及设置随机表情的处理,从而实现身份与表情的解耦,而本专利权利要求1需要利用参考图像的目标表情系数作为模型输出结果并用于对模型进行调整,可见证据4与本专利采用了相反的图像处理方法,并且证据4仅公开了一种利用单幅图像进行3D人脸重建的方法,并不涉及音频相关的特征,也未给出需要对训练后的网络模型进行调整的启示,正是采用了上述区别技术特征,权利要求1获得了生成目标动态图像中的图像更贴近待处理图像中对象的有益的技术效果,因此,权利要求1相对于证据3、证据4的结合具有突出的实质性特点和显著的进步,具备专利法第22条第3款有关创造性的规定。
另外,根据上述对证据3中各个部分的比对分析可知,证据3的各个部分实际涉及图像生成模型的各个阶段,并不是可以相互组合的实施例,因此请求人关于权利要求1相对于证据3的各个实施例的结合不具备专利法第22条第3款规定的创造性的无效理由不成立。
(4.1.3)以证据5作为最接近的现有技术证据5公开了(参见说明书第40-187段及图2-6)图像生成模型的训练方法,如图2所示,包括以下步骤:
S202,从样本图像集合中获取与当前样本对象对应的当前样本图像,其中,样本图像集合中包括与多个样本对象分别对应的多个样本图像子集,一个样本图像子集中包括对应的一个样本对象的多个样本图像;
S204,利用处于训练状态的图像生成模型中的属性特征提取网络提取当前样本图像的属性特征向量,并获取与前样本图像中的当前样本对象的对象标识对应的标识特征向量,其中,属性特征向量用于指示当前样本图像中的当前样本对象的三维图像特征;
S206,将属性特征向量和标识特征向量输入训练状态的图像生成模型中的图像生成网络,得到参考样本图像;
S208,利用处于训练状态的图像生成模型中的判别网络获取参考样本图像与当前样本图像的相似度匹配结果;
S210,在基于相似度匹配结果确定的训练损失满足训练条件的情况下,将处于训练状态的图像生成模型中的属性特征提取网络和图像生成网络作为目标图像生成模型中的目标属性特征提取网络和目标图像生成网络,其中,目标图像生成模型用于基于待重建图像生成目标重建图像,并基于驱动参数驱动所述目标重建图像中的目标对象。
图3、图4、图5对本申请上述实施方式的一个完整训练过程进行说明。在本实施方式中,提出一种基于生成式的高精度人像重建和驱动方法,主要包括三个网络:一个属性提取网络(Attribute Encoder),用于提取图像中人物的姿态、表情、光照等信息;一个身份提取网络(Identity Encoder),用于提取人物的身份信息;以及一个图像生成器(Generator),用于生成特定人物在指定的姿态、表情、光照下的图像。如图3所示,在数据准备阶段,可以从获取同人图片和视频(视频抽帧得到图片),对数据进行整理,每个人给定一个编号IDi,一共有N个人,每个人有若干图片,姿态表情光照等属性各不相同,每张图片能索引到对应的人物编号IDi。
作为一种可选的实施方式,如图5所示,上述图像生成方法可以包括以下步骤:
S502,获取目标图像生成模型,其中,目标图像生成模型为根据样本图像集合对处于训练状态的图像生成模型经过对抗生成训练得到的图像生成模型,样本图像集合中包括与多个样本对象分别对应的多个样本图像子集,一个样本图像子集中包括对应的一个样本对象的多个样本图像;
S504,利用目标图像生成模型中的目标属性特征提取网络提取待重建图像的第一属性特征向量,并获取待重建图像的身份特征向量,其中,属性特征向量用于指示待重建图像中的图像对象的三维图像特征;
S506,将第一属性特征向量和身份特征向量输入目标图像生成模型中的目标图像生成网络,得到与待重建图像匹配的目标重建图像,其中,目标重建图像中包括目标对象,目标对象为待重建图像中的图像对象。
可以理解的是,在本申请上述实施方式中,可以通过待重建图像本身的第一属性特征向量和身份特征向量对带重建图像进行重建操作,得到目标重建图像。可以理解的是,在目标重建图像中包括的目标对象为待重建图像中的图像对象,且目标对象执行的驱动动作与待重建图像中的图像对象的动作相同。也就是说,在本申请上述实施方式中,执行的是基于原图重建的操作。
在一种可选的实施方式中,上述将第一属性特征向量和身份特征向量输入目标图像生成模型中的目标图像生成网络,得到与待重建图像匹配的目标重建图像之后,还包括:
S1,获取驱动参数;
S2,将驱动参数和身份特征向量输入目标图像生成模型中的目标图像生成网络,得到与目标重建图像匹配的目标驱动图像,其中,目标驱动图像中包括执行目标驱动动作的目标对象,目标驱动动作为与驱动图像中的图像对象的对象动作相匹配的动作,目标对象为待重建图像中的图像对象。
可选地,上述获取驱动参数包括以下之一:
方式一、获取驱动图像,并利用目标图像生成模型中的目标属性特征提取网络提取驱动图像的第二属性特征向量,将第二属性特征向量作为驱动参数;
方式二、获取为目标重建图像配置的驱动参数。
可以理解的是,在本实施方式中,提供了两种获取驱动参数的方法,第一种方式可以根据驱动图像获取的第二属性特征向量作为驱动参数;第二种方式可以是直接获取用于驱动目标对象的驱动参数,上述驱动参数可以是根据驱动指令生成,例如,在驱动指令为“作出一个微笑的表情”的情况下,对应的驱动参数可以是用于控制上述目标对象作出上述微笑表情的特征参数。
在一种可选的实施方式中,上述获取待重建图像的身份特征向量包括以下之一:
方式一、获取目标对象标识,将目标对象标识的标识特征向量作为身份特征向量,其中,目标对象标识用于指示待重建图像中的图像对象;
方式二、获取待重建图像,并根据目标图像生成模型中的目标身份特征提取网络提取待重建图像的身份特征向量。
可以理解的是,在基于目标图像生成网络进行图像重建和驱动的过程中,可以至少包括两种使用方式。
在第一种使用方式中,由于在图像生成模型的训练过程中已经对样本图像中的样本对象的对象身份特征进行了充分学习,进而可以在仅获取到驱动图像的情况下,根据用户选定的目标对象标识,获取与对象标识匹配的标识特征向量(即直接获取训练过程中所使用的样本对象的身份特征),并基于驱动图像中的图像对象的属性特征对上述目标对象标识对应的目标对象进行驱动显示,以显示目标对象标识对应的图像对象执行与驱动图像中的图像对象相匹配的对象动作或对象表情;
在第二种使用方式中,以在获取到待重建图像和驱动图像的情况下,利用训练好的目标身份特征提取网络提取待重建图像的身份特征向量,并基于驱动图像中的图像对象的属性特征对上述待重建图像的图像对象进行驱动显示,以显示待重建图像中的图像对象执行与驱动图像中的图像对象相匹配的对象动作或对象表情。
以下对上述图像生成模型的几个具体应用场景进行说明。在一种可选的场景中,可以在用户进行游戏任务的过程中,在用户授权许可的情况下,对当前用户当前面部的图像进行采集,并将采集到的图像作为驱动图像输入上述图像生成模型,再根据用户选择的虚拟形象作为待重建图像,进而基于用户的当前表情驱动游戏中的虚拟形象作出对应的虚拟表情;
在另一种可选的场景中,可以在用户进行直播操作的过程中,在用户授权许可的情况下,对当前用户当前面部的图像进行采集,作为待重建图像;并获取用户输入的音频的音频特征,基于音频特征生成对应的驱动图像,并将驱动图像和待重建图像输入上述图像生成模型,进而基于用户选择的背景音乐所生成的驱动图像中的对象动作,驱动基于用户的当前面部图像进行虚拟直播,例如可以是虚拟唱歌直播。
上述三个网络训练好以后,对于任意给定的真实图像,我们就可以提取他的身份特征和属性特征,然后通过mapping网络将图像对应的属性特征和身份特征映射成StyleGAN的latent向量给到生成器就可以生成重建后的图像。重建完成后,就可以进行驱动,可以从驱动图像上使用属性提取网络抽取姿态表情光照等属性信息,然后和上述重建过程中得到的身份特征进行组合,同步输入至生成器(图像生成子网络),就可以生成驱动后的图像。如图6所示,为基于本申请上述实施方式重建并驱动生成的图像序列的示意图。如图6中的第一行第一张图,可以是用户输入的待重建图像(即真实图像),图6中的第一行第二张至第九张图,为一组驱动图像序列。
根据证据5的上述记载可知,证据5的图2及其相关文字描述了一种图像生成模型的训练方法,图3、
图4、图5及其相关文字描述了一个完整训练过程,其属于模型训练阶段;图6及其相关文字描述了利用图2-5所示的训练好的图像生成模型对一个真实图像进行原图生成,并利用采集到的图像作为驱动图像输入上述图像生成模型进行同步复制用户动作和表情,其属于模型应用阶段。根据上述记载可知,证据5中对于真实图像的处理,首先需要提取真实图像的身份特征,根据提取的身份特征去样本图像集合中获得对应该身份特征的对象分别对应的多个样本图像子集,一个样本图像子集中包括对应的一个样本对象的多个样本图像,然后据此对真实图像进行原图重现,再根据驱动信息进行驱动图像,也就是说真实图像中的对象是该图像生成模型的模型训练过程中的样本图像集合中的样本对象,这个样本图像集合中有该真实图像中的对象的多个图像,
利用这些图像完成原图生成,生成的图像与原图的相似度是符合损失函数要求的。即由于证据5在训练过程中的样本图像集合中已经包括真实图像中的对象,且生成图像的模型输出结果在前面验证后已经满足要求。
也就是说证据5中公开了图像生成模型的训练方法以及对训练完成的图像生成模型的应用,其图像生成模型经过训练后可以直接用于图像生成,并不涉及也不需要对训练后图像生成模型的再调整的内容,更不涉及具体的调整手段;而本专利权利要求1首先有训练后的生成网络模型,然后再利用用户输入的图像作为参考图像对训练后的生成网络模型再进行调整,并且这次对于模型的调整是基于输入的参考图像,该参考图像的对象与待处理图像的对象相同,并不涉及音频内容,以及权利要求1还记载了具体的模型调整手段。可由此可知,本专利权利要求1与证据5对于模型的训练方法是不同的。
因此,本专利权利要求1与证据5的区别技术特征在于:基于所述参考图像和训练后的生成网络模型,
确定目标头部动作特征和目标表情系数特征;所述训练后的生成网络模型用于基于输入的所述参考图像生成多个预测图像,并基于各所述预测图像和所述参考图像之间的区别,确定目标头部动作特征和目标表情系数特征;基于所述目标头部动作特征和所述目标表情系数特征对所述训练后的生成网络模型进行调整,得到目标生成网络模型;基于所述参考音频、所述参考图像和所述目标生成网络模型,对待处理图像进行处理,得到目标动态图像;所述待处理图像与所述参考图像中的图像对象相同。基于上述区别技术特征可以确定权利要求1实际解决的技术问题是如何降低生成精准图像的成本。
根据上述对证据5中各个部分的比对分析可知,证据5的各个部分实际涉及图像生成模型的各个阶段,
并不是可以相互组合的实施例,而且证据5并未公开可以对训练后的图像生成模型的进行再调整的内容,也不涉及具体的调整手段,正是基于上述区别技术特征,权利要求1获得了能够降低生成精准图像成本的有益的技术效果。因此,请求人关于权利要求1相对于证据5的各个实施例的结合不具备专利法第22条第3款规定的创造性的无效理由不成立。
(4.2)关于权利要求2-12权利要求10保护与权利要求1的方法权利要求对应的装置权利要求,基于与权利要求1相同的评述,权利要求10相对于上述相应证据组合也具备专利法第22条第3款规定的创造性。
由于请求人关于权利要求1相对于上述相应证据不具备创造性的无效理由不成立,基于引用基础,请求人关于从属权利要求2-9、权利要求11-12相对于相应证据不具备专利法第22条第3款有关创造性的无效理由也不成立。
综上所述,请求人所有的无效理由均不成立。合议组现依法作出如下决定。
三、决定宣告
维持202410022841.6号发明专利权有效。
当事人对本决定不服的,根据专利法第46条第2款的规定,可以自收到本决定之日起三个月内向北京知识产权法院起诉。根据该款的规定,一方当事人起诉后,另一方当事人作为第三人参加诉讼。
合议组组长:熊婷主审员:吴士芬 专利局复审和无效审理部参审员:林甦
第二部分 文章点评
1. 案件速览
案件编号4W118569
案件类型发明专利权无效宣告
涉案专利号/申请号202410022841.6
审查结论维持专利权有效
主要证据证据1、证据2、证据3、证据4、证据5、证据6、证据7
本案涉及法条:专利法第二十二条第三款
本案为发明专利权无效宣告(案件编号 4W118569),专利号 202410022841.6,发明创造名称为《基于音频生成动态图像的方法、装置、设备及存储介质》。经审理,国家知识产权局作出维持专利权有效的决定。以下结合决定书原文拆解其认定逻辑与实务要点。
2. 当事人主张与答辩(原文摘录)
请求人一方:
请求人于2024年08月01日向国家知识产权局提出了无效宣告请求,其理由是权利要求1-12不符合专利法第22条第3款有关创造性的规定,请求宣告本专利权利要求1-12全部无效,同时提交了如下证据:证据1:CSDN博客网页,胖胖腐乳,“SadTalkerLearningRealistic3DMotionCoefficientsforStylizedAudio-DrivenSingleImageTalking”,https://blog.csdn.net/weixin_419673……
请求人主张:(1)以证据1作为最接近的现有技术,权利要求1、10相对于证据1和证据2的结合,或证据1和公知常识的结合不具备创造性;
程序事项:国家知识产权局本案合议组于2024年10月17日向双方当事人发出了口头审理通知书,定于2024年12月20日举行口头审理,专利权人针对上述无效宣告请求于2024年12月18日提交了意见陈述书,并认为请求人的证据均不涉及本专利权利要求1中的模型微调过程,请求人的无效理由均不成立。
从双方攻防看,本案的胜负手并不在于主张的数量,而在于主张能否落到具体法条的构成要件上,以及所提交证据能否支撑该构成要件的事实基础。
3. 法律适用与要件分析
专利法第二十二条第三款(创造性):适用『三步法』:确定最接近的现有技术 → 确定区别技术特征和实际解决的技术问题 → 判断要求保护的发明对本领域技术人员是否显而易见。其中『实际解决的技术问题』是承上启下的关键:技术问题被界定得越具体、越偏离对比文件的技术语境,越难在其他证据中找到结合启示;反之,若技术问题被概括为常规性能改进,则容易被认定存在技术启示。
本案认定:证据1-7的公开日期均在本专利的申请日之前,属于可以用于评述本专利是否符合专利法第22条第3款规定的创造性的现有技术。
4. 决定的理由:推理链还原
① 审查基础:(一)审查基础本无效宣告请求决定的审查基础为本专利的授权公告文本。
② 区别技术特征:可见,本专利权利要求1与证据1的区别技术特征在于:基于所述参考图像和训练后的生成网络模型,确定目标头部动作特征和目标表情系数特征;
③ 实际解决的技术问题:基于上述区别技术特征可以确定权利要求1实际解决的技术问题是如何使得模型生成的对象更贴近待处理图像中对象。
④ 技术启示判断:而且没有证据表明上述权利要求1与证据1的区别技术特征属于本领域的公知常识,正是采用了上述区别技术特征,权利要求1获得了生成目标动态图像中的图像更贴近待处理图像中对象的有益的技术效果。
⑤ 结论:维持202410022841.6号发明专利权有效。
上述环节构成完整的认定链条:审查基础确定争点所指向的文本,区别特征与技术问题界定判断的起点,技术启示决定最终结论。实务中,争议往往集中在第②③步——区别特征的划分粒度与技术问题的表述方式,直接决定了后续能否在对比文件中找到结合启示。改变其中任何一环,结论都可能不同。
5. 决定要点解读
涉及人工智能应用的技术方案通常包括模型设计、模型训练、模型应用三个阶段。面对涉及 人工智能应用的权利要求时,应站位本领域技术人员,从处理目的、处理对象、处理结果、结果 使用等方面准确理解权利要求的技术术语,确定权利要求记载的技术手段的所处阶段,进而准确 地判断本专利和现有技术记载的技术方案的异同。 模型训练阶段是涉及人工智能应用的技术方案中特定而重要的部分。如果涉及人工智能应用 的权利要求的技术方案与最接近的现有技术虽用于相同的场景但采用了不同的模型训练方法,现 有技术整体上未给出改进模型训练方法的启示,且上述不同的模型训练方法使得该权利要求的技 术方案相对于现有技术获得了诸如模型输出结果更精确或模型训练成本更低的有益的技术效果, 则权利要求的技术方案具备创造性。
该要点是本案最具参照价值的部分:它并非对个案事实的简单复述,而是对某一类法律适用问题提炼出的裁判规则,可在同类案件的审查意见答复、无效请求与答辩中直接援引。适用时须注意其成立的事实前提,避免在事实基础不同的案件中作过度扩张的引用。
6. 结合本案的分析
请求人的无效理由未获支持,专利权维持有效。此类决定的说服力通常来自三个环节之一:证据本身不成立(公开时间、真实性或关联性不足)、区别特征认定对权利人有利、或实际解决的技术问题被界定得足够具体而使得其他证据无法给出启示。就创造性而言,本案可作为「现有技术抗辩未成立」的参照样本,提示请求人在提起无效前应对证据链的完整性与公开时间做更严格的前置核查。
本案请求人提交的证据包括证据1、证据2、证据3、证据4、证据5、证据6。证据的公开时间、真实性与关联性构成本案的三条主线:公开时间决定其能否作为现有技术,真实性决定其能否被采信,关联性决定其能否用于评价涉案权利要求。在无效攻防中,先质证证据资格往往比直接辩论技术内容更为高效。
7. 实务启示与攻防要点
本案主要涉及:创造性、证据认定。以下按不同主体的立场给出可供直接复用的要点。
▸ 关于创造性:本案适用《专利法》第二十二条第三款的『三步法』判断框架。实践中最容易影响结论的是第二步——实际解决的技术问题的界定,以及第三步——结合启示的有无。
对请求人/审查一方:
- 将区别特征尽可能归入常规技术手段或相近领域的通用做法,是削弱创造性的有效路径;两篇以上对比文件的组合须论证结合的动机。
- 挑战专利权人主张的技术效果:若效果未在原始申请中记载,或缺乏实验数据支撑,可主张该效果不能用于确定实际解决的技术问题。
对专利权人/申请人一方:
- 争取更有利的『实际解决的技术问题』表述:技术问题越具体、越贴近区别特征带来的真实改进,越难在其他证据中找到解决方案。
- 论证不存在结合启示:对比文件结合后无法实现涉案发明的功能、或结合存在技术偏见、或需要创造性劳动,均能否定技术启示。
- 辅证非显而易见性:商业成功、克服技术偏见、意料不到的技术效果均可作为创造性判断的辅助考量因素。
▸ 关于证据认定:本案的关键在于证据的资格与证明力。互联网证据、使用公开、自行截屏等事实的认定,取决于信息公开状态是否可验证、证据链是否完整以及举证责任如何分配。
对请求人/审查一方:
- 互联网证据宜通过可信时间戳、公证或权威平台留存,证明其公开时间与内容完整性;自行截屏的证明力较弱,需辅以来源说明。
- 使用公开(销售、展出、投标)应围绕『是否处于公众想得知即可得知的状态』举证,并注意公开的连续性。
对专利权人/申请人一方:
- 从证据形式质证:未固化、来源不明、可自行编辑的网页内容,真实性难以确认。
- 从公开时间质证:无法证明公开时间早于申请日或优先权日的证据,不构成现有技术。
对申请文件撰写的启示:
- 说明书应着重描述区别特征与现有技术之间的差异及其带来的技术效果,并配套实验数据,为后续答复夯实基础。
- 避免把发明点写成常规手段的堆砌,应突出技术要素之间的协同配合关系。
- 研发成果对外发布前完成专利布局,避免自身公开成为在后申请的现有技术。
- 对外展示、投标、参展应留存时间记录与内容清单,便于日后证明或抗辩。
8. 检索与归档提示
建议以「4W118569、202410022841.6、专利法第二十二条第三款、创造性、证据认定」为索引标签归档本案。本案出自「赋青春」《2025年度专利复审无效典型案件决定要点汇编》,可作为同类争议的先例样本:在撰写阶段用于校验权利要求布局,在答复阶段用于寻找论证路径,在无效攻防中用于预判对方主张与自身的退守空间。