基于专利数据挖掘的营销战略研究——以中石化绿色技术创新为例
1. 引言
1.1 研究背景
1.1.1 国家政策支持
- 2022年12月,国家发展改革委和科技部下发《关于进一步完善市场导向的绿色技术创新体系实施方案(2023—2025年)》,提出加快节能降碳先进技术研发攻关和推广应用,引导企业加快绿色低碳转型升级步伐。
- 绿色技术创新在国家政策的支持下,逐渐成为突破核心技术瓶颈、促进经济高质量发展的关键引擎。
1.1.2 企业面临的挑战
- 知识爆炸性增长使得企业利用已有数据库,对技术创新绩效难以进行有效的组织管理与数据挖掘,得出能够促进创新绩效的可持续的公司战略与营销策略。
- 专利数据作为世界上最大的技术知识源,具有保护核心技术和设置技术准入门槛的双重作用,为量化分析企业知识资源起到了重要支撑保障。
1.2 研究意义
- 通过专利数据挖掘,识别出中石化在绿色技术创新过程中的潜在营销战略和核心技术发展轨迹,为理解和指导化工企业如何通过专利数据挖掘来构建绿色技术创新战略提供重要的理论和实践意义。
- 研究也存在局限,如数据来源的偏差和LDA算法的局限性,建议未来通过实证调查和案例研究进一步验证研究结论。
2. 文献回顾
2.1 绿色技术创新的概念界定
- 绿色技术创新是将“绿色技术”作为主语,用以强调创新行为的主题内容或对象。
- 绿色技术创新以“绿色”限制“技术创新”,实现经济效益和生态效益的统一,促进经济社会新质生产力形成。
2.2 动态能力建设与绿色技术创新
- 动态能力概念由Teece和Pisano(1994)提出,指机构整合、构建、重新配置内外部能力以应对快速变化的外界环境。
- 动态能力包括感知能力、学习能力和创新能力三个维度,在动态变化的外部环境下,具备与外部发展环境相匹配的动态能力是企业成功实现战略转型的关键。
2.3 综合协同治理与绿色技术创新
- 绿色技术创新目标的实现会受到相关利益主体行为的影响,多主体参与成为了绿色技术创新过程中的显著特点。
- 企业需要综合平衡政府财政补贴、绿色金融、企业数字责任与消费者福祉等影响因素,在动态能力建设的基础上,协同多主体治理绿色技术创新战略。
3. 研究设计
3.1 研究方法
- LDA 分析模型是一种文档主题概率生成模型,也称为一个三层贝叶斯概率模型,包含词、主题和文档三层结构。
- LDA 模型可以用来识别大规模文档集或语料库中潜藏的主题信息,且其算法核心思想为降维。
3.2 研究流程
3.2.1 数据收集
- 样本企业专利数据来源于智慧芽信息科技有限公司的智慧芽专利索引数据库,选择中石化作为案例企业,是因为其在进行绿色技术创新的过程同时采用综合协同治理与动态能力建设两种理论,具有绿色技术创新研究的代表性与启发性。
3.2.2 数据预处理
- 使用python中的nltk库,经过对初始数据库进行专利缺失、重复和无效短文本的剔除操作后,可用于文本挖掘的专利数据为51470条。
- 对专利数据集的专利摘要进行文本预处理,经过文本清洗、切分、去特殊字符、去停用词、拼写检查、词形还原和特征提取等预处理步骤后,将高度非结构化的初始专利文本数据转化为可被计算机识别和处理的词向量数据。
3.2.3 最优主题数目
- 在概率语言模型中,困惑度是用来评估语言模型优劣的指标,其基本思想是给测试集赋予较高概率值的语言模型,较好且较小的困惑度意味着模型对文本集有较好的预测作用。
- 当主题数为 11时,困惑值达到了最低点,此时对于样本数据的有效信息度拟合值为最佳。
3.2.4 数据挖掘及结果展示
- 本研究通过 Python 语言实现 LDA 主题算法整个过程,完成了对中石化企业化工专利数据的主题挖掘,算法参数的最优输入采用K值为11,超参数α和 β采用 Python 中算法经验的默认值。
- 最终结果形成如下表所示。其中,强度代表了每一个主题在总文档中的占比,数量代表了每一个主题所包含的文档数量。
3.3 研究案例概况
- 中国石油化工股份有限公司(以下简称中石化),一个全球领先的油气化工公司,由中国石油化工集团单独发起创建。
- 中石化不仅继承了集团公司的勘探、油气开采、炼油、化工以及相关产品的销售业务,还扩展到了技术进出口和R&D应用领域。
- 从2021年开始,中石化积极拓展新能源领域,不仅涉及氢气的生产、储存、运输和销售,还涉及新能源汽车充电、太阳能、风能等多种技术,并提供全面的技术支持。




