第一部分 决定书原文
扉页
| 复审请求人 | 中国经济信息社有限公司 | 申请号 | 202310326430.1 |
| 申请日 | 2023年03月30日 | 优先权日 | — |
| 公开日 | 2023年07月28日 | 复审请求日 | 2025年01月17日 |
| 法律依据 | 专利法第22条第3款 | 审查结论 | 维持驳回决定 |
决定要点
决定要点如果一项权利要求请求保护的技术方案与最接近的现有技术相比存在区别特征,但部分区别特 征被其它对比文件公开且所起作用相同,其余区别特征是本领域惯用手段,并且对本领域技术人员 而言,该权利要求请求保护的技术方案相对于上述最接近的现有技术与其它对比文件和本领域惯用 手段的结合是显而易见的,则该权利要求不具备创造性。
一、案由
本复审请求审查决定涉及申请号为202310326430.1,名称为“一种企业品牌海外传播数据分析方法、系统和存储介质”的发明专利申请(下称“本申请”)。本申请的申请人为中国经济信息社有限公司,申请日为2023年03月30日,公开日为2023年07月28日。
经实质审查,国家知识产权局实质审查部门于2024年10月29日发出驳回决定,驳回了本申请。驳回决定所针对的审查文本为:2024年10月11日提交的权利要求第1-5项,申请日2023年03月30日提交的摘要附图、说明书附图1-6页、说明书第1-14页、说明书摘要。
驳回决定中引用了以下对比文件:
对比文件1:CN107169632A,公开日为2017年09月15日;
对比文件2:CN111694952A,公开日为2020年09月22日。
驳回决定的理由是:权利要求1-5相对于对比文件1、对比文件2和本领域公知常识的结合不具备专利法第22条第3款规定的创造性。
驳回决定所针对的权利要求1-5的内容如下:
“1.一种企业品牌海外传播数据分析方法,其特征在于,包括:
获取目标时间段内的多个目标企业的第一企业品牌海外传播数据,并对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据;
将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据;
将所有的目标分析数据存储至目标数据库,并通过预设数据输出方式,将所有的目标分析数据进行输出显示;
所述目标数据分析模型的数量为多个,多个目标数据分析模型包括:声量趋势分析模型、热点分析模型、
自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型和情感分析模型;
所有的目标分析数据包括:多个第一目标分析数据、多个第二目标分析数据、多个第三目标分析数据、
多个第四目标分析数据、多个第五目标分析数据、多个第六目标分析数据、多个第七目标分析数据、多个第八目标分析数据、多个第九目标分析数据;所述将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据的步骤,包括:
将所有的第二海外传播数据输入至所述声量趋势分析模型,得到多个包含日期和声量值的第一目标分析数据;
将所有的第二海外传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;
将所有的第二海外传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;
将所有的第二海外传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据;
将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据;
将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据;
将所有的第二海外传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据;
将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据;
将所有的第二海外传播数据输入至所述情感分析模型,得到多个包含情感倾向值的第九目标分析数据;
还包括:
获取多个预设时间段的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练,得到所述目标数据分析模型;
所述数据清洗的过程包括:
从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤。
2.根据权利要求1所述的企业品牌海外传播数据分析方法,其特征在于,所有的第一企业品牌海外传播数据包括:境外新闻网站数据、境外财经网站数据、企业工商数据、企业英文官网数据。
3.根据权利要求2所述的企业品牌海外传播数据分析方法,其特征在于,所述目标数据库为:分布式搜索引擎数据库,所述预设数据输出方式为:API+JSON接口方式。
4.一种企业品牌海外传播数据分析系统,其特征在于,包括:获取模块、分析模块和输出模块;
所述获取模块用于:获取目标时间段内的多个目标企业的第一企业品牌海外传播数据,并对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据;
所述分析模块用于:将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据;
所述输出模块用于:将所有的目标分析数据存储至目标数据库,并通过预设数据输出方式,将所有的目标分析数据进行输出显示;
所述目标数据分析模型的数量为多个,多个目标数据分析模型包括:声量趋势分析模型、热点分析模型、
自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型和情感分析模型;
所有的目标分析数据包括:多个第一目标分析数据、多个第二目标分析数据、多个第三目标分析数据、
多个第四目标分析数据、多个第五目标分析数据、多个第六目标分析数据、多个第七目标分析数据、多个第八目标分析数据、多个第九目标分析数据;所述分析模块220具体用于:
将所有的第二海外传播数据输入至所述声量趋势分析模型,得到多个包含日期和声量值的第一目标分析数据;
将所有的第二海外传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;
将所有的第二海外传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;
将所有的第二海外传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据;
将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据;
将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据;
将所有的第二海外传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据;
将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据;
将所有的第二海外传播数据输入至所述情感分析模型,得到多个包含情感倾向值的第九目标分析数据;
还包括:训练模块;所述训练模块用于:
获取多个预设时间段的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练,得到所述目标数据分析模型;
所述数据清洗的过程包括:
从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤。
5.一种存储介质,其特征在于,所述存储介质中存储有指令,当计算机读取所述指令时,使所述计算机执行如权利要求1至3中任一项所述的企业品牌海外传播数据分析方法。”申请人(下称“复审请求人”)对上述驳回决定不服,于2025年01月17日向国家知识产权局提出了复审请求,并提交了权利要求书的全文修改替换页。具体修改方式为:修改后的权利要求1的技术方案与驳回决定针对的文本相比,删除了“所述数据清洗的过程包括:从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤”,并将上述删除的特征作为新增加的从属权利要求2;同时,修改后的权利要求3的技术方案与驳回决定针对的文本相比,删除了“所述数据清洗的过程包括:从所有的第一企业品牌海外传播数据中,
将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤”,同时,在修改后的独立权利要求1或3中增加了说明书的相关内容,并对权利要求的编号和引用关系进行了适应性调整,重新编号为权利要求1-4。复审请求人认为修改后的权利要求1-4具备创造性,并在复审请求书中陈述了具体理由。
经形式审查合格,国家知识产权局于2025年01月20日依法受理了该复审请求,并对其进行前置审查。
前置审查意见坚持驳回决定。
随后,国家知识产权局成立合议组对本案进行审理。
合议组于2025年04月09日向复审请求人发出复审通知书。复审通知书指出:(1)复审请求人于2025年01月17日提出复审请求时提交的权利要求书的修改文本,修改后的独立权利要求1、3相对于驳回决定针对的独立权利要求1、4而言,删除了部分技术特征,导致扩大了保护范围,同时将上述删除的特征作为新增加的从属权利要求2,复审请求人对权利要求书的上述修改并非是针对驳回决定指出的缺陷进行的修改,不符合专利法实施细则第66条的规定。因此,合议组对复审请求人于2025年01月17日提交的权利要求书修改文本不予接受,对之前可接受的驳回决定所针对的文本进行审查。(2)经审查,合议组发现实质审查阶段中用于评述本申请不具备创造性的对比文件2文献的公开号标注存在明显笔误, 在本申请实质审查阶段的两次审查意见通知书正文、以及驳回决定中记载了所引用的对比文件2(即公开号 CN111694952A的中国专利文献)。经核查,在上述审查意见通知书正文“驳回理由”部分所援引的对比文件2的具体公开内容与前述标记的文献(即公开号CN111694952A的中国专利文献)记载内容明显不符,故上述审查意见通知书、驳回决定中所标注的对比文件2文献的公开号存在明显笔误。经比对,合议组发现在实质审查阶段用于评述本申请不具备创造性的对比文件2实际为:公开号CN112035658A的中国专利文献(该文献被引用在检索报告中),该文献的具体内容与上述审查意见通知书和驳回决定中所援引的对比文件2的相关段落和公开内容相符,且具体评述理由已经随审查通知书和驳回决定告知申请人。因此,从解决申请人争议、避免程序震荡、有利于节约审查程序的角度考虑,本复审通知书对实质审查阶段所引用的对比文件2的错误文件编号进行更正(正确公开号为CN112035658A的中国专利文献,公开日为2020年12月04日),同时合议组引入两篇公知常识性证据。复审通知书指出:2024年10月11提交的权利要求第1-5项相对于对比文件1、对比文件2和本领域公知常识的结合不具备专利法第22条第3款规定的创造性。(4)合议组对复审请求人的复审请求意见进行了针对性答复,且进一步指出:针对复审请求人于复审请求时提交的修改后的权利要求1、3中新增加的其他技术特征(涉及声量趋势分析模型、热点分析模型、自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型的具体实现方式和情感分析模型的具体实现方式,目标数据库、第一企业品牌海外传播数据的具体范畴等),即使复审请求人将其加入权利要求中,这些增加的技术特征被对比文件1或2公开,或属于本领域公知常识,本申请的方案也仍不具备创造性。
复审请求人于2025年05月09日提交了意见陈述书和权利要求书的修改文本。具体修改方式为:相对于提交复审请求时的权利要求1-4而言,将从属权利要求2合并至独立权利要求1,删除从属权利要求2,对其他权利要求的序号和引用关系进行适应性修改。复审请求人认为:(1)首先,本申请修改后的权利要求1具备针对企业品牌海外传播场景的特定数据清洗规则,如语言过滤、企业名称强制关联等,这与对比文件2提及的通用数据清洗(如过滤停用词)不同,也无法由公知常识中的去重、去噪等通用规则推导得出,其设计需结合领域知识,并非本领域技术人员常规实验可得。同时,对比文件1、2均未将分时段采集训练数据与特定清洗规则结合,二者协同能显著提升模型适应性与分析精度。(2)本申请修改后的权利要求1通过多模型协同(如文本聚类、实体消歧、自动摘要等)及分时段采集训练数据优化模型参数,实现“高质量输入-精准分析-动态优化”闭环,还针对企业品牌数据特性优化模型组合(如声量趋势分析采用HMM+CRF、情感分析融合FastText与BERT)。而对比文件1的“多维度评分”缺乏细粒度分析能力,对比文件2的舆情监测未针对企业品牌场景优化,二者模型设计目标与本申请不同,未给出将多种模型组合应用于品牌分析的启示。
复审请求人于2025年05月09日答复复审通知书时提交的权利要求1-3的内容如下:
“1.一种企业品牌海外传播数据分析方法,其特征在于,包括:
获取目标时间段内的多个目标企业的第一企业品牌海外传播数据,并对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据;
将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据;
将所有的目标分析数据存储至目标数据库,并通过预设数据输出方式,将所有的目标分析数据进行输出显示;
还包括:
获取多个预设时间段的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练,得到所述目标数据分析模型;
所述目标数据分析模型的数量为多个,多个目标数据分析模型包括:声量趋势分析模型、热点分析模型、
自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型和情感分析模型;
所有的目标分析数据包括:多个第一目标分析数据、多个第二目标分析数据、多个第三目标分析数据、
多个第四目标分析数据、多个第五目标分析数据、多个第六目标分析数据、多个第七目标分析数据、多个第八目标分析数据、多个第九目标分析数据;所述将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据的步骤,包括:
将所有的第二海外传播数据输入至所述声量趋势分析模型,得到多个包含日期和声量值的第一目标分析数据;
其中,声量趋势分析模型根据专家标注的文本规则,从文本中选择对该项任务有影响的各种特征,并将这些特征加入到特征向量中;依据隐马尔可夫模型、条件随机场模型得到特定命名实体所面临的主要困难和所表现出的特性,选择最能有效反映该类实体特性的特征集合;
将所有的第二海外传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;
其中,热点分析模型采用了规则与统计相结合的方法标引关键词,集合了两种方法的各自优点;既可根据行业主题词表标引关键词,也可根据专家总结的自动标引规则和新词发现模块来获取关键词;针对词语在文本中的出现位置与出现频率,在背景库的分布情况方面,综合性的对词语进行打分,根据打分结果的高低筛选关键词;
将所有的第二海外传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;
其中,自动摘要模型为利用计算机按照某类应用自动地将文本或文本集合转换成简短摘要;自动摘要模型整体上是一个端到端的模型,分为编码器和解码器两部分,编码器采用预训练模型BERT,解码器采用多层注意力机制;
将所有的第二海外传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据;
其中,文本聚类模型通过自动地对文本进行特征抽取,构造文本的“指纹”,然后根据该“指纹”到文本“指纹库”中检索与该文本相似或相同的文本;对文本进行分词和词性标注,使用特征提取技术,抽取有用的文本特征,将提取的文本特征表示成文档本“指纹”;到文本指纹库中检索与当前文档最相似的文档;
将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据;
其中,多维度数据分析模型采取基于贝叶斯的标签分类方法;
将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据;
其中,实体识别模型将实体识别任务当做基于序列标注的分类问题;该方法使用的深度神经网络主要包括Embedding层,双向RNN层,tanh隐层以及最后的CRF层构成;RNN常用LSTM或者GRU;
将所有的第二海外传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据;
其中,文本分类模型利用CNN的自动分类过程为:将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出结果;
将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据;
其中,实体消歧模型是根据人工建立敏感词表,通过机器基于该敏感词表对目标文本进行简单的匹配查询,以确定目标文本的敏感度,再基于CNN的自动分类过程,将文本中的每个词或字符用词向量进行表示,
将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出文本最终敏感度;
将所有的第二海外传播数据输入至所述情感分析模型,得到多个包含情感倾向值的第九目标分析数据;
其中,情感分析模型融合了FastText和BERT两种分类模型;FastText是基于Facebook开源的一个词向量计算和文本分类工具,在文本分类任务上,FastText能够取得和深度神经网络相媲美的准确度,但在模型的训练时间上却比深度神经网络快许多数量级;同时为了弥补FastText未使用全局语义信息而造成的信息丢失问题,在BERT预训练模型的基础上搭建了一个文本分类器,充分利用BERT能够根据上下文来学习全局文本信息的特点来进一步的提升系统对文本分类的效果;
所有的第一企业品牌海外传播数据包括:境外新闻网站数据、境外财经网站数据、企业工商数据、企业英文官网数据;
所述目标数据库为:分布式搜索引擎数据库,所述预设数据输出方式为:API+JSON接口方式;其中,
将所有的目标分析数据以key-value的形式存储至分布式搜索引擎数据库,并通过API+JSON的输出方式,
将所有的目标分析数据进行输出显示;
所述数据清洗的过程包括:
从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤。
2.一种企业品牌海外传播数据分析系统,其特征在于,包括:获取模块、分析模块和输出模块;
所述获取模块用于:获取目标时间段内的多个目标企业的第一企业品牌海外传播数据,并对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据;
所述分析模块用于:将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据;
所述输出模块用于:将所有的目标分析数据存储至目标数据库,并通过预设数据输出方式,将所有的目标分析数据进行输出显示;
还包括:训练模块;所述训练模块用于:
获取多个预设时间段的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练,得到所述目标数据分析模型;
所述目标数据分析模型的数量为多个,多个目标数据分析模型包括:声量趋势分析模型、热点分析模型、
自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型和情感分析模型;
所有的目标分析数据包括:多个第一目标分析数据、多个第二目标分析数据、多个第三目标分析数据、
多个第四目标分析数据、多个第五目标分析数据、多个第六目标分析数据、多个第七目标分析数据、多个第八目标分析数据、多个第九目标分析数据;所述分析模块具体用于:
其中,声量趋势分析模型根据专家标注的文本规则,从文本中选择对该项任务有影响的各种特征,并将这些特征加入到特征向量中;依据隐马尔可夫模型、条件随机场模型得到特定命名实体所面临的主要困难和所表现出的特性,选择最能有效反映该类实体特性的特征集合;
将所有的第二海外传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;
其中,热点分析模型采用了规则与统计相结合的方法标引关键词,集合了两种方法的各自优点;既可根据行业主题词表标引关键词,也可根据专家总结的自动标引规则和新词发现模块来获取关键词;针对词语在文本中的出现位置与出现频率,在背景库的分布情况方面,综合性的对词语进行打分,根据打分结果的高低筛选关键词;
将所有的第二海外传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;
其中,自动摘要模型为利用计算机按照某类应用自动地将文本或文本集合转换成简短摘要;自动摘要模型整体上是一个端到端的模型,分为编码器和解码器两部分,编码器采用预训练模型BERT,解码器采用多层注意力机制;
将所有的第二海外传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据;
其中,文本聚类模型通过自动地对文本进行特征抽取,构造文本的“指纹”,然后根据该“指纹”到文本“指纹库”中检索与该文本相似或相同的文本;对文本进行分词和词性标注,使用特征提取技术,抽取有用的文本特征,将提取的文本特征表示成文档本“指纹”;到文本指纹库中检索与当前文档最相似的文档;
将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据;
其中,多维度数据分析模型采取基于贝叶斯的标签分类方法;
将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据;
其中,实体识别模型将实体识别任务当做基于序列标注的分类问题;该方法使用的深度神经网络主要包括Embedding层,双向RNN层,tanh隐层以及最后的CRF层构成;RNN常用LSTM或者GRU;
将所有的第二海外传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据;
其中,文本分类模型利用CNN的自动分类过程为:将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出结果;
将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据;
其中,实体消歧模型是根据人工建立敏感词表,通过机器基于该敏感词表对目标文本进行简单的匹配查询,以确定目标文本的敏感度,再基于CNN的自动分类过程,将文本中的每个词或字符用词向量进行表示,
将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出文本最终敏感度;
将所有的第二海外传播数据输入至所述情感分析模型,得到多个包含情感倾向值的第九目标分析数据;
其中,情感分析模型融合了FastText和BERT两种分类模型;FastText是基于Facebook开源的一个词向量计算和文本分类工具,在文本分类任务上,FastText能够取得和深度神经网络相媲美的准确度,但在模型的训练时间上却比深度神经网络快许多数量级;同时为了弥补FastText未使用全局语义信息而造成的信息丢失问题,在BERT预训练模型的基础上搭建了一个文本分类器,充分利用BERT能够根据上下文来学习全局文本信息的特点来进一步的提升系统对文本分类的效果;
所有的第一企业品牌海外传播数据包括:境外新闻网站数据、境外财经网站数据、企业工商数据、企业英文官网数据;
所述目标数据库为:分布式搜索引擎数据库,所述预设数据输出方式为:API+JSON接口方式;
3.一种存储介质,其特征在于,所述存储介质中存储有指令,当计算机读取所述指令时,使所述计算机执行如权利要求1所述的企业品牌海外传播数据分析方法。”在上述程序的基础上,合议组认为本案事实已经清楚,可以作出复审请求审查决定。
二、决定的理由
(一)审查文本的认定复审请求人于2025年05月09日答复复审通知书时提交了权利要求书的修改文本,经审查,该修改符合专利法第33条。本复审请求审查决定依据的审查文本为:申请日2023年03月30日提交的摘要附图、说明书附图1-6页、说明书第1-14页、说明书摘要,2025年05月09日提交的权利要求第1-3项。
(二)关于专利法第22条第3款专利法第22条第3款规定:创造性,是指与现有技术相比,该发明具有突出的实质性特点和显著的进步,
该实用新型具有实质性特点和进步。
本复审请求审查决定所引用的对比文件与复审通知书所引用的对比文件相同,其中对于实质审查阶段审查意见通知书、驳回决定中所标注对比文件2的文件编号的明显错误进行更正(正确公开号为CN112035658A的中国专利文献),即:
对比文件1:CN107169632A,公开日为2017年09月15日;
对比文件2:CN112035658A,公开日为2020年12月04日。
另外,本复审通知书引入与复审通知书相同的两份公知常识性证据如下:
公知常识性证据1:《医学人工智能导论》,唐子惠著,第382-386页,上海科学技术出版社,公开日为2020年04月30日;
公知常识性证据2:《数据仓库与数据挖掘技术及应用研究》,刘三满著,第166页,中国原子能出版社,公开日为2020年03月31日。
上述公知常识性证据可以通过扫描以下二维码获得:
权利要求1-3不具备专利法第22条第3款规定的创造性。
1、权利要求1要求保护一种企业品牌海外传播数据分析方法,对比文件1公开了一种全球媒体形象分析方法,并具体公开如下技术内容(参见说明书第1-5、48、51-88段以及附图1):
本发明的目的在于提供全球媒体形象分析方法、装置和系统,其能提供媒体形象清晰全面且准确真实的数据参考。
本发明的有益效果在于:从互联网信息中获取海量数据,通过机器抓取分析与目标政企相关的全球媒体资讯报道,通过相关关键词、正负面语义分析,从热词、企业、机构、名人、企业家、关注度、媒体报道情绪态度曲线等多个维度对企业全球媒体形象予以界定得出全球媒体形象报告(相当于一种企业品牌海外传播数据分析方法),快速让企业、机构明确自身的媒体形象与影响力数据,从而为未来的品牌推广、招商引资、
举办大型活动提供清晰全面、准确真实的数据参考。全球媒体涵盖了全世界各语种媒体,如将全球媒体分为三大类:国际媒体。
全球媒体形象分析方法,如图1所示,包括如下步骤:步骤101、从网络获取媒体报道内容;具体的:
通过关键字,利用网络爬虫技术从网络上获取媒体报道内容;关键字包括政企关键字、相关产品、人名和地区关键词等,媒体报道内容包括全球媒体报道内容中与政府、企业相关的指定单位时间段内的媒体报道内容信息(相当于获取目标时间段内的多个目标企业的第一企业品牌海外传播数据)。步骤102、对媒体报道内容提取内容关键词,根据识别模型和内容关键词,对媒体报道内容进行评分。步骤103、按照预设维度将媒体报道内容分类成若干个维度,如果分析的对象是企业,则预设维度包括:产品形象、组织形象、人员形象和品牌竞争力(相当于多维度数据分析)。步骤104、对每个维度的媒体报道内容提取内容关键词,根据识别模型(相当于目标数据分析模型)和每个维度的内容关键词,对每个维度进行评分,得到子评分(相当于将所有的海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据)。具体的,对每个维度的媒体报道内容提取内容关键词,统计每个内容关键词出现的次数,根据内容关键词及其出现的次数形成该维度的媒体报道内容的特征向量,根据建立好的识别模型中的情绪词典矩阵和该媒体报道内容的特征向量,分析该维度的媒体报道内容的正负面,计算该维度的评分;每个维度的媒体报道内容包括对应该维度的文章和报道等内容。识别模型将媒体报道情绪对应分为正面和负面,通过百分比区间来表示正负面,0为负面情绪,
100为正面情绪,越悲观绝望则越趋近于0,满意高兴则趋近于100%。将海量的网络全球媒体报道内容对应到正负面百分比各个区间进行识别训练,根据判断结果不断调整以建立识别模型(相当于目标数据分析模型包括情感分析模型,将所有的海外传播数据输入至所述情感分析模型,得到多个包含情感倾向值的第九目标分析数据;目标分析数据包括多个第九目标分析数据)。识别模型的建立过程包括如下步骤:获取海量互联网的全球媒体报道内容信息(相当于获取企业品牌海外传播训练数据),利用TF-IDF算法提取情绪关键词;计算每个关键词出现的次数,建立情绪关键词典矩阵,以此作为神经网络模型的输入项;获取全球媒体报道内容信息对应表达的观点正负面倾向程度对应正负面的区间数据,并建立正负区间输出矩阵;以此作为神经网络模型的输出项,进行训练。根据识别结果通过反复调整参数进行训练,从而建立识别模型(相当于将所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练,得到所述目标数据分析模型)。步骤105、根据媒体报道内容的评分、预设维度以及子评分形成可视化分析报告。可视化分析报告包括媒体态度各时间周期变化曲线图表(相当于通过预设数据输出方式,将所有的目标分析数据进行输出显示)。预设维度还包括总体指数、年(月)度关注度、地理关注度、媒体关注度、热词关注度和媒体报道情绪态度曲线。
该权利要求所要求保护的技术方案与对比文件1所公开的技术内容相比,二者区别技术特征在于:(1)获取多个预设时间段内的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练;所有的第一企业品牌海外传播数据包括:境外新闻网站数据、
境外财经网站数据、企业工商数据、企业英文官网数据;(2)对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据;所述数据清洗的过程包括:从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤;所述目标数据分析模型的数量为多个,多个目标数据分析模型包括:声量趋势分析模型、热点分析模型、自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型;该声量趋势分析模型、热点分析模型、自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型的具体实现方式和情感分析模型的具体实现方式;所有的目标分析数据包括:多个第一目标分析数据、多个第二目标分析数据、多个第三目标分析数据、多个第四目标分析数据、多个第五目标分析数据、多个第六目标分析数据、多个第七目标分析数据、多个第八目标分析数据;所述将所有的第二海外传播数据输入至目标数据分析模型进行分析处理,得到多个目标分析数据的步骤,包括:将所有的第二海外传播数据输入至所述声量趋势分析模型,得到多个包含日期和声量值的第一目标分析数据;将所有的第二海外传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;将所有的第二海外传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;将所有的第二海外传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据;将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据;将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据;将所有的第二海外传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据;
将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据;将所有的目标分析数据存储至目标数据库;目标数据库为:分布式搜索引擎数据库,所述预设数据输出方式为:
API+JSON接口方式;其中,将所有的目标分析数据以key-value的形式存储至分布式搜索引擎数据库,并通过API+JSON的输出方式输出显示。
基于上述区别特征,可以确定权利要求1相对于对比文件1实际解决的技术问题是:(1)如何避免训练数据偏差;(2)如何提高目标数据分析模型的精准度。
针对区别技术特征(1),如前所述,对比文件1公开了将采集获取的海外传播数据输入至目标数据分析模型进行分析处理,从互联网信息中获取海量数据,通过机器抓取分析与目标政企相关的全球媒体资讯报道,
通过相关关键词、正负面语义分析,从热词、企业、机构、名人、企业家、关注度、媒体报道情绪态度曲线等多个维度对企业全球媒体形象予以界定得出全球媒体形象报告。可见,对比文件1与本申请的发明构思非常相近。同时,对于本领域技术人员而言,为了发现数据的动态变化特性,通常情况下会分不同时间段采集数据,然后区分时间段进行后续数据分析工作,这属于本领域技术人员的常规设置。因此,为了准确地采集数据以便后续进行分析处理,本领域技术人员基于对比文件1公开的前述内容结合所掌握的普通技术知识,
能够容易想到获取多个预设时间段内的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练。另外,对比文件1公开了(参见说明书第52段):媒体报道内容包括全球媒体报道内容中与政府、企业相关的指定单位时间段内的媒体报道内容信息。在对比文件1公开内容的基础上,本领域技术人员根据实际应用需求容易想到企业品牌海外传播数据可以是境外新闻网站数据、境外财经网站数据、企业工商数据以及企业英文官网数据,以利于开展海外营销和市场拓展工作。
针对区别技术特征(2),对比文件2(CN112035658A)公开了一种基于深度学习的企业舆情监测方法,
并具体公开如下技术内容(参见说明书第79-146段以及附图1-7):本实施例提供一种基于深度学习的企业舆情监测方法,其包括以下步骤:1、话题分类:通过多层次判别方法快速准确地进行话题分类。如图1所示,
获取资讯的标题和内容,计算任两篇资讯的标题的Jaccard相似度,若Jaccard相似度大于第一设定阈值则将两篇资讯归为同一话题,否则对两篇资讯的内容进行Simhash编码,计算两个Simhash编码的Hamming距离,若Hamming距离大于第二设定阈值则将两篇资讯归为同一话题,否则认为不是同一话题资讯,分类后的同一话题中将最新发布的资讯的标题作为该话题的标题展示(相当于文本分类模型,目标分析数据包括多个第七目标分析数据;将所有的传播数据输入至所述文本分类模型,得到多个包含所属领域的第七目标分析数据)。2、
主题及热词提取:步骤S1:利用预先定义的主题-热词词典检索同一话题下所有资讯包含的热词(相当于根据行业主题词表标引关键词)。步骤S2:通过主题与热词的映射关系得出同一话题所涉及的主题集合。步骤S3:
根据分词工具jieba对同一话题下的所有资讯内容进行分词并依据预先定义的停用词库去除停用词,避免某些噪声词汇影响关键词的检索。步骤S4:从去除停用词的分词中提取词频-逆文本频率TF-TDF大于阈值μ的词作为关键词。步骤S5:查询预先存储在数据库中的关键词及主题所对应的200维腾讯词向量,若提取出的某一关键词未查询到对应的词向量,则随机生成200维的向量代替其词向量。步骤S6:计算每个主题与所有关键词的余弦相似度;步骤S7:在(3)式得到的相似度大于给定阈值δ的前提下,将关键词添加到其对应的主题热词中(相当于热点分析模型,目标分析数据包括多个第二目标分析数据;将所有的传播数据输入至所述热点分析模型,得到多个包含文章关键词的第二目标分析数据;针对词语在文本中的出现位置与出现频率,在背景库的分布情况方面,综合性的对词语进行打分,根据打分结果的高低筛选关键词)。3、资讯调性分析;
资讯评论情感分类骨干网络图结构基础框架主要由输入层(Input)、嵌入层(Embedding)、Dropout层、双向GRU层(BiGRU)、全局池化层(GlobalMaxPooling)、Softmax层组成。嵌入层采用提前训练好的权重矩阵W(由Word2vec训练而来),训练过程不更改权重,为了提高鲁棒性,在输入BiGRU(units:200)前添加一层Dropout(设置为0.2),将GRU双向输出拼接并进行全局池化,再通过Softmax得到评论样本类别的概率进行分类(相当于深度神经网络主要包括Embedding层,双向RNN层;RNN常用GRU)。4、话题调性分析;5、话题和资讯的声量、
生命值分析:在统计资讯和相应话题的声量时,考虑转发量、评论量(跟帖量)、点赞量、网民参与度、资讯发布用户质量、曝光度、热度等维度,并且按小时和天为单位分别进行实时统计,从而达到对舆情传播状况进行全方位追踪的目的。另外,生命值的变化反应了舆情发展的趋势,该指标通过声量中的热度值衍生得到(相当于声量趋势分析模型,目标分析数据包括多个第一目标分析数据;将所有的传播数据输入至所述声量趋势分析模型,得到多个包含日期和声量值的第一目标分析数据)。6、关联资讯推荐:某一事件的爆发往往伴随着若干条资讯的发布,为了查看当前资讯详情页的同时能够便捷地跳转到同一话题下关联强度较高的资讯,
需要考虑对共同话题中的关联资讯进行推荐。而资讯之间的关联强度衡量是关键,考虑到有些资讯是直接抄袭而来,其中只是做了小部分的修改,因此需要通过计算资讯之间的相似度对关联强度进行衡量,并设置两个阈值进行分割,选取相似度在两个阈值之间的资讯作为同一话题下的备选关联资讯,接着通过计算该备选关联资讯与关联资讯集合中的若干条资讯的相似度,从而判断计算出的相似度中最小值是否小于给定的两个阈值中较大阈值来决定该备选关联资讯能否添加到关联资讯集合中(相当于文本聚类模型,目标分析数据包括多个第四目标分析数据;将所有的传播数据输入至所述文本聚类模型,得到多个包含文本相似度值的第四目标分析数据)。如图6所示,步骤S1:从数据库中获取同一话题下包含实体(企业名称)的资讯文档(相当于实体识别)。步骤S2:对同一话题中被选出包含企业名称的资讯集分别进行分词、去停用词处理。步骤S3:遍历资讯集中分词处理后的每篇资讯,并与资讯集中剩余的所有资讯分别做BM25相似度计算;步骤S4:判断目标资讯Q与候选资讯D的BM25相似度是否在阈值区间(α,β)之内,满足条件则将资讯D添加到目标资讯对应的关联资讯集合中。7、资讯摘要抽取:移动端企业舆情监测系统中的最底层是资讯详情页,资讯详情页中的顶部生成了摘要,该模块对资讯中所有的句子进行了重要度评估,评估的维度包括句子的位置信息、句子长度及其对全文的概括能力等,对各维度的数值进行量化并加权融合得以选出评估值最高的若干个句子组成自动摘要(相当于自动摘要模型,目标分析数据包括多个第三目标分析数据;将所有的传播数据输入至所述自动摘要模型,得到多个包含文章摘要的第三目标分析数据;鉴于前述多个分析模型为多个,因此上述内容相当于目标分析模型的数量为多个)。如图7所示,步骤S1:通过设定规则对话题中的资讯内容进行清洗、过滤(相当于对传播数据进行数据清洗,所述数据清洗的过程包括过滤)。步骤S2:将资讯正文按句号、问号、
叹号进行分割组成句子集合,并对每个句子做分词、去停用词处理。
根据上述内容可见,对比文件2公开了上述相关区别特征,且该技术特征在对比文件2中的作用与其在本申请中相同,都是为了提高传播数据分析的精准度,因此对比文件2给出了将该技术特征应用于对比文件1的技术启示。此外,如前所述,对比文件1公开了全球媒体内容包括海外数据;对比文件2公开了通过设定规则对话题中的资讯内容进行清洗、过滤,以及对每个句子做分词、去停用词处理。在此基础上,对于本领域技术人员而言,根据实际分析场景的需求,设定不同的数据清洗、过滤规则,这是本领域的惯用手段。因此,在针对企业品牌海外传播数据进行分析的业务场景下,本领域技术人员基于上述现有技术及所掌握的普通技术知识,根据实际应用场景需求容易想到设定的具体规则可以是从所有的第一企业品牌海外传播数据中,
将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤。
其次,如前所述,对比文件1公开了将采集获取的海外传播数据输入至目标数据分析模型进行分析处理,
在此基础上结合对比文件2公开的声量趋势分析模型、热点分析模型、自动摘要模型、文本聚类模型以及文本分类模型等多个目标数据分析模型和数据清洗步骤,本领域技术人员容易想到将经过数据清洗得到的第二海外传播数据输入至对应的目标数据分析模型,得到多个目标分析数据。并且,对比文件1公开了(参见同上):如果分析的对象是企业,则预设维度包括:产品形象、组织形象、人员形象和品牌竞争力。也即,对比文件1公开了针对采集的海外传播数据进行多维度分析。对比文件2公开了(参见同上):从数据库中获取同一话题下包含实体(企业名称)的资讯文档。也即,对比文件2公开了对咨询文档等传播内容中的企业名称等实体进行识别。在此基础上,为了提高多维度分析、实体识别的准确性,本领域技术人员容易想到设置对应的多维度数据分析模型和实体识别模型,将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据,将所有的第二海外传播数据输入至所述实体识别模型,得到多个包含区域实体的第六目标分析数据。
再次,对于本领域技术人员而言,在自然语言处理领域,为了确保实体唯一性,提高上下文分析能力,
通常会设置实体消歧步骤。例如,参见公知常识性证据1,其中(参见第385-386页):文本信息抽取的具体任务包括实体识别、实体消歧、关系抽取、事件抽取。一个实体指称项可对应到多个真实世界实体,确定一个实体职称项所指向的真实世界实体,这就是命名实体消歧。根据上述公知常识性证据1公开的内容,为了提高识别的准确度,本领域技术人员容易想到设置对应的实体消歧模型,将所有的第二海外传播数据输入至所述实体消歧模型,得到多个筛除无效数据的第八目标分析数据,这种设置对本领域技术人员而言无需付出创造性劳动。另外,将分析所得的目标分析数据存储至目标数据库以方便后续调用查询,这也是本领域的惯用技术手段。
而关于权利要求1中限定的声量趋势分析模型、热点分析模型、自动摘要模型、文本聚类模型、多维度数据分析模型、实体识别模型、文本分类模型、实体消歧模型、情感分析模型的具体实现方式,针对声量趋势分析模型的具体实现方式“其中,声量趋势分析模型根据专家标注的文本规则,从文本中选择对该项任务有影响的各种特征,并将这些特征加入到特征向量中;依据隐马尔可夫模型、条件随机场模型得到特定命名实体所面临的主要困难和所表现出的特性,选择最能有效反映该类实体特性的特征集合”,对比文件2公开了(参见说明书第107-125段):话题和资讯的声量、生命值分析。也即对比文件2公开了声量趋势分析模型。
对于本领域技术人员而言,隐马尔可夫模型、条件随机场模型等本领域常见的文本数据分析模型;在此基础上,本领域技术人员根据实际应用场景需求,经过特征工程筛选得到需要的特征集合,这也是本领域的常规设置。例如,参见公知常识性证据1,其中记载了(参见第382-383页):传统的机器学习分类方法将整个文本分类问题拆分成了特征工程和分类器两部分,特征工程分为文本预处理、特征提取、文本表示三个部分,
最终目的是把文本转换成计算机可理解的格式,并封装足够用于分类的信息,即很强的特征表达能力。文本预处理过程是在文本中提取关键词表示文本的过程,中文文本处理中主要包括文本分词和停用词两个阶段。
传统算法主要有基于字符串匹配的正向、逆向或双向最大匹配,基于理解的句法和语义分析消歧,基于统计的互信息/CRF方法。近年来随着深度学习的应用,词嵌入联合Bi+LSTM+CRF方法逐渐成为主流。特征选择的基本思路是根据某个评价指标独立地对原始特征项(词项)进行评分排序,从中选择得分最高的一些特征项,过了掉其余的特征项。在此基础上,为了提高声量趋势分析模型的分析准确性,本领域技术人员容易想到声量趋势分析模型根据专家标注的文本规则,从文本中选择对该项任务有影响的各种特征,并将这些特征加入到特征向量中;依据隐马尔可夫模型、条件随机场模型得到特定命名实体所面临的主要困难和所表现出的特性,选择最能有效反映该类实体特性的特征集合。
针对热点分析模型的具体实现方式“其中,热点分析模型采用了规则与统计相结合的方法标引关键词,
集合了两种方法的各自优点;既可根据行业主题词表标引关键词,也可根据专家总结的自动标引规则和新词发现模块来获取关键词;针对词语在文本中的出现位置与出现频率,在背景库的分布情况方面,综合性的对词语进行打分,根据打分结果的高低筛选关键词”,如前所述,对比文件2(参见说明书第85-96段)公开了根据行业主题词表标引关键词,针对词语在文本中的出现位置与出现频率,在背景库的分布情况方面,综合性的对词语进行打分,根据打分结果的高低筛选关键词。在此基础上,为了及时跟进行业内高频热词,提高热点分析模型的分析精准度,本领域技术人员容易想到还可以通过专家总结的自动标引规则和新词发现模块来获取关键词,这对本领域技术人员而言无需付出创造性劳动。
针对自动摘要模型的具体实现方式“其中,自动摘要模型为利用计算机按照某类应用自动地将文本或文本集合转换成简短摘要;自动摘要模型整体上是一个端到端的模型,分为编码器和解码器两部分,编码器采用预训练模型BERT,解码器采用多层注意力机制”,如前所述,对比文件2(参见说明书第136-146段)公开了自动摘要模型为利用计算机按照某类应用自动地将文本或文本集合转换成简短摘要的相关特征。对于本领域技术人员而言,以BERT作为编码器,多层注意力机制作为解码器的端到端模型是等本领域常见的文本数据分析模型。例如,参见公知常识性证据1,其中记载了(参见第383-385页):深度学习解决大规模文本分类问题最重要的是解决文本表示,再利用卷积神经网络或循环神经网络等网络结构自动获取特征表达能力,去掉繁杂的人工特征工程,端到端地解决问题。(5)BERT模型结构:主要采用了Transformer的编码结构,其主要创新点在于训练方式采用了它在训练双向语言模型时以减小的概率把少量的词替成了掩码或者另一个随机的词,目的在于使模型被迫增加对上下文的记忆;增加了一个预测下一句的损失,迫使模型学习到句子之间的关系。在此基础上,为了提高自动摘要模型的分析准确性,本领域技术人员容易想到自动摘要模型整体上是一个端到端的模型,分为编码器和解码器两部分,编码器采用预训练模型BERT,解码器采用多层注意力机制。
针对文本聚类模型的具体实现方式“文本聚类模型通过自动地对文本进行特征抽取,构造文本的“指纹”,然后根据该“指纹”到文本“指纹库”中检索与该文本相似或相同的文本;对文本进行分词和词性标注,
使用特征提取技术,抽取有用的文本特征,将提取的文本特征表示成文档本“指纹”;到文本指纹库中检索与当前文档最相似的文档”,对比文件2公开了(参见说明书第127-135段):通过计算资讯之间的相似度对关联强度进行衡量,并设置两个阈值进行分割,选取相似度在两个阈值之间的资讯作为同一话题下的备选关联资讯,接着通过计算该备选关联资讯与关联资讯集合中的若干条资讯的相似度,从而判断计算出的相似度中最小值是否小于给定的两个阈值中较大阈值来决定该备选关联资讯能否添加到关联资讯集合中。也即,对比文件2公开了根据文档之间的相似度进行文本聚类。对于本领域技术人员而言,通过提取最具有特征表达能力的特征构成文档“指纹”,并基于文档“指纹”的相似性判断文档之间的相似性是本领域常见的文本数据分析方法。例如,参见公知常识性证据2,其中记载了(参见第166页):通过哈希算法将每一个文档转换成一个哈希吗或指纹,通过比较指纹的相似程度来分析文本内容的相似程度。在此基础上,为了提高文本聚类模型的分析准确性,本领域技术人员容易想到文本聚类模型通过自动地对文本进行特征抽取,构造文本的“指纹”,然后根据该“指纹”到文本“指纹库”中检索与该文本相似或相同的文本;对文本进行分词和词性标注,使用特征提取技术,抽取有用的文本特征,将提取的文本特征表示成文档本“指纹”;到文本指纹库中检索与当前文档最相似的文档。
针对多维度数据分析模型的具体实现方式“其中,多维度数据分析模型采取基于贝叶斯的标签分类方法”,
对比文件1公开了(参见说明书第56段):步骤103、按照预设维度将媒体报道内容分类成若干个维度,如果分析的对象是企业,则预设维度包括:产品形象、组织形象、人员形象和品牌竞争力。也即,对比文件1公开了对媒体报道内容进行多维度数据分析。对于本领域技术人员而言,贝叶斯是本领域常见的文本数据分析模型。例如,参见公知常识性证据1,其中记载了(参见第382-383页):在众多的分类算法中,常用的典型分类算法有决策树、最大熵、贝叶斯和支持向量机算法。在此基础上,为了提高多维度数据分析模型的分析准确性,本领域技术人员容易想到多维度数据分析模型采取基于贝叶斯的标签分类方法。
针对实体识别模型的具体实现方式“其中,实体识别模型将实体识别任务当做基于序列标注的分类问题;
该方法使用的深度神经网络主要包括Embedding层,双向RNN层,tanh隐层以及最后的CRF层构成;RNN常用LSTM或者GRU”,如前所述,对比文件2(参见说明书第97-101段)公开了用于进行资讯评论情感分类骨干网络图结构的基础框架主要包括Embedding层,双向RNN层;RNN常用GRU的相关特征。对于本领域技术人员而言,tanh隐层是文本数据分析模型中常见的网络层,结合LSTM或GRU等RNN层和CRF以实现文本实体识别文本也是本领域的惯用技术手段。例如,参见公知常识性证据1,其中记载了(参见第383页):词嵌入联合Bi-LSTM+CRF 方法逐渐成为主流。在此基础上,为了提高实体识别模型的分析准确性,
本领域技术人员容易想到实体识别模型将实体识别任务当做基于序列标注的分类问题;该方法使用的深度神经网络主要包括Embedding层,双向RNN层,tanh隐层以及最后的CRF层构成;RNN常用LSTM或者GRU。
针对文本分类模型的具体实现方式“文本分类模型利用CNN的自动分类过程为:将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层 merge 之后采用 softmax 算法得出输出结果”,对比文件 2 公开了(参见说明书第 80-84段):1、话题分类:通过多层次判别方法快速准确地进行话题分类。也即,对比文件2公开了对文本进行分类。对于本领域技术人员而言,基于CNN模型实现文本分类是本领域的惯用技术手段。例如,参见公知常识性证据1,其中记载了(参见第384页):TextCNN详细过程:第一层是图中最左边的7*5的句子矩阵,
每行是词向量,维度=5,这个可以类比为图像中的原始像素点。然后经过卷积核大小等于(2,3,4)的一维卷积层,每个卷积核有两个输出通道。第三层是一个1-max池化层,这样不同长度句子经过池化层之后都能变成定长的表示,最后接一层全连接的softmax层,输出每个类别的概率。在此基础上,为了提高文本分类模型的分析准确性,本领域技术人员容易想到文本分类模型利用CNN的自动分类过程为:将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出结果。
针对实体消歧模型的具体实现方式“实体消歧模型是根据人工建立敏感词表,通过机器基于该敏感词表对目标文本进行简单的匹配查询,以确定目标文本的敏感度,再基于CNN的自动分类过程,将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出文本最终敏感度”。对于本领域技术人员而言,
在自然语言处理领域,为了确保实体唯一性,提高上下文分析能力,通常会设置实体消歧步骤;基于CNN模型实现文本数据分析是本领域的惯用技术手段。例如,参见公知常识性证据1,其中记载了(参见第384-386页):TextCNN详细过程:第一层是图中最左边的7*5的句子矩阵,每行是词向量,维度=5,这个可以类比为图像中的原始像素点。然后经过卷积核大小等于(2,3,4)的一维卷积层,每个卷积核有两个输出通道。第三层是一个1-max池化层,这样不同长度句子经过池化层之后都能变成定长的表示,最后接一层全连接的softmax层,输出每个类别的概率。文本信息抽取的具体任务包括实体识别、实体消歧、关系抽取、事件抽取。
一个实体指称项可对应到多个真实世界实体,确定一个实体职称项所指向的真实世界实体,这就是命名实体消歧。在此基础上,为了提高文本数据分析的准确性,本领域技术人员容易想到根据人工建立敏感词表,通过机器基于该敏感词表对目标文本进行简单的匹配查询,以确定目标文本的敏感度,再基于CNN的自动分类过程,将文本中的每个词或字符用词向量进行表示,将一维文本变成二维矩阵形式,然后用卷积核做多层卷积运算、池化、tanh激活降维,再将多个层merge之后采用softmax算法得出输出文本最终敏感度。
针对情感分析模型的具体实现方式“其中,情感分析模型融合了FastText和BERT两种分类模型;FastText是基于Facebook开源的一个词向量计算和文本分类工具,在文本分类任务上,FastText能够取得和深度神经网络相媲美的准确度,但在模型的训练时间上却比深度神经网络快许多数量级;同时为了弥补FastText未使用全局语义信息而造成的信息丢失问题,在BERT预训练模型的基础上搭建了一个文本分类器,充分利用BERT能够根据上下文来学习全局文本信息的特点来进一步的提升系统对文本分类的效果”。对比文件1公开了(参见说明书第70段):将海量的网络全球媒体报道内容对应到正负面百分比各个区间进行识别训练,根据判断结果不断调整以建立识别模型。也即,对比文件1公开了对文本数据进行情感分析。对于本领域技术人员而言,FastText和BERT是本领域常用的的文本数据分析模型。例如,参见公知常识性证据1,其中记载了(参见第383-385页):(1)FastText:原理是把句子中所有的词向量进行平均,然后直接连接softmax层。
同时加入了一些N元语言模型特征来捕捉局部序列信息。(5)BERT模型结构:主要采用了Transformer的编码结构,其主要创新点在于训练方式采用了它在训练双向语言模型时以减小的概率把少量的词替成了掩码或者另一个随机的词,目的在于使模型被迫增加对上下文的记忆;增加了一个预测下一句的损失,迫使模型学习到句子之间的关系。在此基础上,为了提高情感分析模型的分析准确性,本领域技术人员容易想到情感分析模型融合FastText和BERT两种分类模型,弥补FastText未使用全局语义信息而造成的信息丢失问题,
在BERT预训练模型的基础上搭建一个文本分类器,充分利用BERT能够根据上下文来学习全局文本信息的特点来进一步的提升系统对文本分类的效果。
另外,对比文件1公开了(参见说明书第77段):步骤105、根据媒体报道内容的评分、预设维度以及子评分形成可视化分析报告。可视化分析报告包括媒体态度格式件周期变化曲线图表。也即,对比文件1公开了将所有的目标分析数据进行输出显示。对于本领域技术人员而言,在数据量较大信息管理场景中,分布式搜索引擎数据库可以根据业务需求灵活扩展节点数量,是常见的数据库类型。另外,API+JSON接口方式是数据处理领域中常见的数据输出方式,key-value是数据处理领域常见的数据存储方式。本领域技术人员基于上述现有技术及其具备的知识水平和能力能够容易得到和实现上述设置。
因此,在对比文件1的基础上结合对比文件2以及本领域惯用技术手段得到该权利要求的技术方案对本领域技术人员而言是显而易见的,即该权利要求所要保护的技术方案不具有突出的实质性特点,不具备专利法第22条第3款规定的创造性。
2、权利要求2要求保护一种企业品牌海外传播数据分析系统,该权利要求的模块功能与权利要求1的方法步骤基本对应,二者实质技术方案相比仅在权利要求1的基础上缺省了技术特征“其中,将所有的目标分析数据以key-value的形式存储至分布式搜索引擎数据库,并通过API+JSON的输出方式,将所有的目标分析数据进行输出显示;所述数据清洗的过程包括:从所有的第一企业品牌海外传播数据中,将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤”,因此,基于与权利要求1相类似的评述理由,该权利要求2相对于对比文件1、对比文件2以及本领域惯用技术手段的结合也不具备专利法第22条第3款规定的创造性。
3、权利要求3要求保护一种存储介质,对于本领域技术人员而言,将计算机程序存储于计算机可读存储介质中,方便被处理器执行以实现相应的方法,这属于本领域的惯用技术手段。因此,基于与权利要求1相类似的评述理由,在权利要求1任一项的方法不具备创造性的前提下,该权利要求也不具备专利法第22条第3款规定的创造性。
(三)对复审请求人相关意见的评述针对复审请求人于2025年05月09日提交的意见陈述,合议组认为:
(1)首先,参见前述对权利要求1的评述意见,对比文件1公开的全球媒体形象分析方法中用于后续分析的媒体报道内容包括全球媒体报道内容中与政府、企业相关的指定单位时间段内的媒体报道内容信息,也即对比文件1中的全球媒体内容包括某一单位时间段内的海外数据;进一步地,对比文件2公开了通过设定规则对话题中的资讯内容进行清洗、过滤,以及对每个句子做分词、去停用词处理。在此基础上,对于本领域技术人员而言,根据实际分析场景的需求,设定不同的数据清洗、过滤规则,这是本领域的惯用手段。因此,在针对企业品牌海外传播数据进行分析的业务场景下,本领域技术人员基于上述现有技术及所掌握的普通技术知识,根据实际应用场景需求容易想到设定的具体规则可以是从所有的第一企业品牌海外传播数据中,
将包含非英文数据的第一企业品牌海外传播数据,仅包含标题的第一企业品牌海外传播数据,包含排除词或敏感词的第一企业品牌海外传播数据,以及没有包含任一目标企业的企业全称或企业简称的第一企业品牌海外传播数据进行过滤。另外,关于“分时段采集训练数据与特定清洗规则的结合”,本申请权利要求1中仅限定了“获取目标时间段内的多个目标企业的第一企业品牌海外传播数据,并对所有的第一企业品牌海外传播数据进行数据清洗,得到多个第二企业品牌海外传播数据”以及具体的前述数据清洗过程,可以看出,所谓“结合”,也仅仅体现在对目标时间段内的多个第一企业品牌海外传播数据进行数据清洗,而基于对比文件1公开了获取指定单位时间段内的媒体报道内容信息进行后续分析,进一步结合对比文件2给出的通过设定规则对话题中的资讯内容进行清洗、过滤的相关技术启示,本领域技术人员可以根据企业品牌海外传播数据分析的具体场景需求容易想到基于特定的数据清洗规则对目标时间段内的多个第一企业品牌海外传播数据进行数据清洗,以实现分时段采集训练数据和特定清洗规则的结合,协同提升模型适应性和分析精度。(2)其次,
如前所述,对比文件1公开了(参见说明书第48段):从互联网信息中获取海量数据,通过机器抓取分析与目标政企相关的全球媒体资讯报道,通过相关关键词、正负面语义分析,从热词、企业、机构、名人、企业家、关注度、媒体报道情绪态度曲线等多个维度对企业全球媒体形象予以界定得出全球媒体形象报告,快速让企业、机构明确自身的媒体形象与影响力数据,从而为未来的品牌推广、招商引资、举办大型活动提供清晰全面、准确真实的数据参考。根据上述内容可知,对比文件1能够实现对企业品牌海外传播策略进行具体研判、对其未来品牌提升计划提出有针对性的建议,为企业的国家品牌管理工作提供参考的技术效果。可见,
对比文件1与本申请的发明构思非常相近。并且,依据前述对权利要求1的评述意见,在对比文件1公开了对输入的媒体报道内容进行情感分析、多维度评分的基础上结合对比文件2公开的针对资讯舆情信息进行声量趋势分析、热点分析、自动摘要提取、文本聚类和文本分类的多模型协同的综合数据分析等相关内容以及本领域的公知常识,本领域技术人员能够得到本申请所述的企业品牌海外传播数据分析方法和具体的多个模型实现方式,从而实现对采集的大量企业品牌海外传播数据进行融合分析,优化企业品牌分析结果的技术效果。而根据对本申请说明书的理解,关于本申请所述的“多维度”具体指媒体、国家等地理维度,对比文件1公开了(参见同上):如果分析的对象是企业,则预设维度包括:产品形象、组织形象、人员形象和品牌竞争力。也即,对比文件1公开了针对采集的海外传播数据进行多维度分析。此外,本领域技术人员知晓,在企业品牌海外传播分析场景下,媒体传播渠道、地域分布对品牌影响力评估至关重要。基于对比文件1公开了从多视角解析企业媒体形象,本领域技术人员为了更全面掌握企业品牌在海外的传播态势,自然会想到考虑引入媒体、国家和大洲等维度,从而将所有的第二海外传播数据输入至所述多维度数据分析模型,得到多个包含媒体、国家和大洲的第五目标分析数据,这对本领域技术人员而言并不需要付出创造性的劳动。
综上所述,合议组对复审请求人的意见不予支持,并依法作出如下决定。
三、决定宣告
驳回复审请求人于2025年01月17日对本申请提出的复审请求。
如对本复审请求审查决定不服,根据专利法第41条第2款的规定,复审请求人可以自收到本决定之日起三个月内向北京知识产权法院起诉。
合议组组长:武磊主审员:张敏姣 专利局复审和无效审理部参审员:赵文华
第二部分 文章点评
1. 案件速览
案件编号1F742449
案件类型发明专利申请驳回复审
涉案专利号/申请号202310326430.1
审查结论维持驳回决定
主要证据对比文件1、对比文件2
本案涉及法条:专利法实施细则第六十六条专利法第二十二条第三款专利法第三十三条
本案为发明专利申请驳回复审(案件编号 1F742449),申请号 202310326430.1,发明创造名称为《一种企业品牌海外传播数据分析方法、系统和存储介质》。经审理,国家知识产权局作出维持驳回决定。以下结合决定书原文拆解其认定逻辑与实务要点。
2. 当事人主张与答辩(原文摘录)
驳回决定的认定与复审请求人的主张:
复审请求人认为修改后的权利要求1-4具备创造性,并在复审请求书中陈述了具体理由。
复审请求人认为:(1)首先,本申请修改后的权利要求1具备针对企业品牌海外传播场景的特定数据清洗规则,如语言过滤、企业名称强制关联等,这与对比文件2提及的通用数据清洗(如过滤停用词)不同,也无法由公知常识中的去重、去噪等通用规则推导得出,其设计需结合领域知识,并非本领域技术人员常规实验可得。
申请人/复审请求人一方:
复审请求人认为修改后的权利要求1-4具备创造性,并在复审请求书中陈述了具体理由。
复审请求人认为:(1)首先,本申请修改后的权利要求1具备针对企业品牌海外传播场景的特定数据清洗规则,如语言过滤、企业名称强制关联等,这与对比文件2提及的通用数据清洗(如过滤停用词)不同,也无法由公知常识中的去重、去噪等通用规则推导得出,其设计需结合领域知识,并非本领域技术人员常规实验可得。
从双方攻防看,本案的胜负手并不在于主张的数量,而在于主张能否落到具体法条的构成要件上,以及所提交证据能否支撑该构成要件的事实基础。
3. 法律适用与要件分析
专利法实施细则第六十六条(复审通知书的答复):合议组认为必要的,可以向复审请求人发出复审通知书,请求人应当在指定期限内答复。期满未答复的,复审请求视为撤回;答复时可以对申请文件进行修改,但修改不得超出原申请记载的范围。
本案认定:(一)审查文本的认定复审请求人于2025年05月09日答复复审通知书时提交了权利要求书的修改文本,经审查,该修改符合专利法第33条。
专利法第二十二条第三款(创造性):适用『三步法』:确定最接近的现有技术 → 确定区别技术特征和实际解决的技术问题 → 判断要求保护的发明对本领域技术人员是否显而易见。其中『实际解决的技术问题』是承上启下的关键:技术问题被界定得越具体、越偏离对比文件的技术语境,越难在其他证据中找到结合启示;反之,若技术问题被概括为常规性能改进,则容易被认定存在技术启示。
本案认定:(二)关于专利法第22条第3款专利法第22条第3款规定:创造性,是指与现有技术相比,该发明具有突出的实质性特点和显著的进步,该实用新型具有实质性特点和进步。
专利法第三十三条(修改不得超出原申请记载范围):修改的边界是『原说明书和权利要求书记载的范围』,包括明确记载的内容与本领域技术人员可直接、毫无疑义确定的内容。将不同权利要求的特征重新组合作进一步限定时,须考察特征之间是否存在不可分割的配合关系;孤立抽取存在配合关系的特征进行重组,通常会被认定超范围。
本案认定:(一)审查文本的认定复审请求人于2025年05月09日答复复审通知书时提交了权利要求书的修改文本,经审查,该修改符合专利法第33条。
4. 决定的理由:推理链还原
① 审查基础:驳回决定所针对的审查文本为:2024年10月11日提交的权利要求第1-5项,申请日2023年03月30日提交的摘要附图、说明书附图1-6页、说明书第1-14页、说明书摘要。
② 区别技术特征:该权利要求所要求保护的技术方案与对比文件1所公开的技术内容相比,二者区别技术特征在于:(1)获取多个预设时间段内的企业品牌海外传播训练数据,并将每个预设时间段对应的所有企业品牌海外传播训练数据输入至预设数据分析模型进行迭代训练;
③ 实际解决的技术问题:基于上述区别特征,可以确定权利要求1相对于对比文件1实际解决的技术问题是:(1)如何避免训练数据偏差;
④ 技术启示判断:根据上述内容可见,对比文件2公开了上述相关区别特征,且该技术特征在对比文件2中的作用与其在本申请中相同,都是为了提高传播数据分析的精准度,因此对比文件2给出了将该技术特征应用于对比文件1的技术启示。
⑤ 合议组认定:(三)对复审请求人相关意见的评述针对复审请求人于2025年05月09日提交的意见陈述,合议组认为:(1)首先,参见前述对权利要求1的评述意见,对比文件1公开的全球媒体形象分析方法中用于后续分析的媒体报道内容包括全球媒体报道内容中与政府、企业相关的指定单位时间段内的媒体报道内容信息,也即对比文件1中的全球媒体内容包括某一单位时间段内的海外数据;
⑥ 结论:驳回复审请求人于2025年01月17日对本申请提出的复审请求。
上述环节构成完整的认定链条:审查基础确定争点所指向的文本,区别特征与技术问题界定判断的起点,技术启示决定最终结论。实务中,争议往往集中在第②③步——区别特征的划分粒度与技术问题的表述方式,直接决定了后续能否在对比文件中找到结合启示。改变其中任何一环,结论都可能不同。
5. 决定要点解读
如果一项权利要求请求保护的技术方案与最接近的现有技术相比存在区别特征,但部分区别特 征被其它对比文件公开且所起作用相同,其余区别特征是本领域惯用手段,并且对本领域技术人员 而言,该权利要求请求保护的技术方案相对于上述最接近的现有技术与其它对比文件和本领域惯用 手段的结合是显而易见的,则该权利要求不具备创造性。
该要点是本案最具参照价值的部分:它并非对个案事实的简单复述,而是对某一类法律适用问题提炼出的裁判规则,可在同类案件的审查意见答复、无效请求与答辩中直接援引。适用时须注意其成立的事实前提,避免在事实基础不同的案件中作过度扩张的引用。
6. 结合本案的分析
合议组维持了驳回决定。就复审通知书的答复、创造性、修改不得超出原申请记载范围而言,说明申请人提出的复审理由未能改变原认定,常见原因是:意见陈述停留在结论性主张而缺少对「区别特征—技术问题—技术启示」链条的针对性反驳,或未能提供足以支撑技术效果的证据。此类案件提示:复审阶段的价值不在于重复申请文件的表述,而在于精准识别驳回理由的推理断点。
本案请求人提交的证据包括对比文件1、对比文件2。证据的公开时间、真实性与关联性构成本案的三条主线:公开时间决定其能否作为现有技术,真实性决定其能否被采信,关联性决定其能否用于评价涉案权利要求。在无效攻防中,先质证证据资格往往比直接辩论技术内容更为高效。
7. 实务启示与攻防要点
本案主要涉及:创造性、权利要求清楚/支持。以下按不同主体的立场给出可供直接复用的要点。
▸ 关于创造性:本案适用《专利法》第二十二条第三款的『三步法』判断框架。实践中最容易影响结论的是第二步——实际解决的技术问题的界定,以及第三步——结合启示的有无。
对请求人/审查一方:
- 将区别特征尽可能归入常规技术手段或相近领域的通用做法,是削弱创造性的有效路径;两篇以上对比文件的组合须论证结合的动机。
- 挑战专利权人主张的技术效果:若效果未在原始申请中记载,或缺乏实验数据支撑,可主张该效果不能用于确定实际解决的技术问题。
对专利权人/申请人一方:
- 争取更有利的『实际解决的技术问题』表述:技术问题越具体、越贴近区别特征带来的真实改进,越难在其他证据中找到解决方案。
- 论证不存在结合启示:对比文件结合后无法实现涉案发明的功能、或结合存在技术偏见、或需要创造性劳动,均能否定技术启示。
- 辅证非显而易见性:商业成功、克服技术偏见、意料不到的技术效果均可作为创造性判断的辅助考量因素。
▸ 关于权利要求清楚/支持:本案涉及《专利法》第二十六条第四款:权利要求是否清楚、是否以说明书为依据。该条款的核心是把权利要求的保护范围锚定在说明书记载的技术贡献之内,防止权利人获得超出其贡献的保护。
对请求人/审查一方:
- 从术语入手:自造词、模糊的程度用语、非常规参数,是攻击保护范围不清楚的有效切入点。
- 从支持入手:统计实施例数量与权利要求覆盖范围的比值,指出权利要求概括的范围远超说明书验证的范围。
对专利权人/申请人一方:
- 术语解释应站位本领域技术人员,结合说明书、附图及本领域通常含义进行限定性解释,不宜按字面含义作最宽解释。
- 必要时通过进一步限定的方式将权利要求收缩至说明书实施例能够支撑的范围,换取权利稳定性。
对申请文件撰写的启示:
- 说明书应着重描述区别特征与现有技术之间的差异及其带来的技术效果,并配套实验数据,为后续答复夯实基础。
- 避免把发明点写成常规手段的堆砌,应突出技术要素之间的协同配合关系。
- 尽量避免自造词;确需使用的,应在说明书中给出明确定义。
- 权利要求层级应形成梯度:独立权利要求适度概括,从属权利要求层层收缩,为后续修改预留空间。
8. 检索与归档提示
建议以「1F742449、202310326430.1、专利法实施细则第六十六条、专利法第二十二条第三款、专利法第三十三条、创造性、权利要求清楚/支持」为索引标签归档本案。本案出自「赋青春」《2025年度专利复审无效典型案件决定要点汇编》,可作为同类争议的先例样本:在撰写阶段用于校验权利要求布局,在答复阶段用于寻找论证路径,在无效攻防中用于预判对方主张与自身的退守空间。