全部
百万节点的知识图谱是怎么构建起来的?
本文所述知识图谱构建技术,是特赞GEA上下文系统(Context System)的底层知识层,与语境理解、语义索引共同构成三层架构。该图谱以百万级节点规模,将品牌、产品、场景、受众关系编码为可推理的图结构,是GEA从语言拼接走向真正企业认知推理、由工具进化为会思考的企业智能体的技术基础。
分类
全部
发布日期
2026-08-14
阅读时间
7 分钟阅读
为什么企业 AI 需要知识图谱
在企业经营中,品牌调性、产品卖点、客户洞察、业务场景——每一类信息本身就是一个庞大的知识体系,而这些体系之间存在复杂的关联。当 AI 介入内容生产和业务决策时,它面对的第一个挑战不是生成能力,而是知识结构:它是否真正理解「品牌」「场景」「受众」这些概念之间的关系,还是只会把词语拼接在一起。
知识图谱解决的正是这个问题。它把概念、实体和关系以图结构组织起来,让机器在推理时能沿着关系路径走,而不只是做词语匹配。特赞的企业知识图谱节点规模超过百万,覆盖品牌、产品、场景、人物、行业术语等多个维度,底层使用无监督开放信息抽取(Open Information Extraction,OIE)技术构建。
传统做法为什么走不通
在知识图谱之前,企业通常用人工词典或结构化数据库管理知识。前者费人工,更新慢,覆盖不全;后者依赖提前设计好的表结构,遇到新概念就要改 schema。
更根本的问题是,这两种方式记录的是「事实」,不记录「关系」。知道「某品牌是一家技术公司」和知道「该品牌的技术方向」「技术方向对应的核心场景」「场景依赖的能力」,是完全不同的认知层次。后者才是真正能驱动 AI 推理的知识结构。
还有体量问题。企业信息更新极快,新品牌、新产品、新需求持续涌现。百万节点这个规模,靠人工标注是做不到的——人工标注的上限由标注成本决定,而企业数据的增长速度远超这个上限。
什么是无监督 OIE
Open Information Extraction(开放信息抽取)从自然语言文本中自动抽取结构化三元组,形式是「主体—关系—客体」。比如从「某品牌在 2024 年推出了新系列」中抽取出(某品牌,推出,新系列)。
「开放」的含义是不预先定义关系类型。传统关系抽取需要先确定一套标签(如「属于」「竞品是」),再训练模型识别预定义关系。OIE 不做这个约束,它尽可能抽取文本中所有可见的语义关系,无论这种关系是否出现在预定义列表中。
「无监督」则意味着不需要人工标注的训练样本。这是做到百万节点的关键——OIE 直接从原始文本的语言结构中推断三元组,不依赖标签数据,规模上限由语料量而非标注成本决定。
从多模态资产到图结构
特赞的知识图谱处理的不只是文本,还包括图片、视频等多模态资产。完整的抽取路径分三个阶段。
第一阶段,多模态内容理解。 对图片和视频做内容识别——识别其中的品牌元素、产品品类、场景类型和人物特征,把非结构化的视觉内容转化为可处理的文本描述。
第二阶段,三元组抽取。 对文本运行 OIE 模型,识别实体和关系,输出大量原始三元组。这一步的质量参差不齐,有真实的语义关系,也有因语言现象(比喻、省略、指代)产生的噪声。
第三阶段,图谱融合与清洗。 把原始三元组合并进统一图结构。这个过程需要处理实体对齐——「苹果」「Apple」「苹果公司」在不同文档中可能指同一实体,需要识别并合并。同时过滤置信度过低的关系,保留高质量连接。
图谱在 AI 产品里怎么发挥作用
构建完成的知识图谱不是静态档案,而是 AI 推理的基础设施,在三个层面发挥作用。
一是检索增强。 当用户提出内容需求时,系统不只搜索关键词匹配的资产,还沿图谱的关系路径召回语义相关内容——哪些品牌、产品品类、视觉风格在历史上与这个场景强相关,检索质量远高于纯文本搜索。
二是生成约束。 生成某品牌内容时,模型从图谱中获取该品牌的关联属性(价格带、目标受众、品牌调性),确保生成内容在这些维度上保持一致,不出现调性偏移。
三是持续更新。 新资产持续被摄入,OIE 模型持续从中抽取新三元组,融合进现有图谱。节点和关系随业务数据增长而增长,知识基底越用越厚。
值得注意的边界
无监督 OIE 的抽取精度不如有监督方法,规模优势的代价是每个三元组的可靠性需要通过后处理保障。置信度过滤和人工抽样校验是工程落地中不可省略的环节。
另一个限制来自领域特异性。通用 OIE 模型在专业企业语料上的表现通常低于预期,因为行业语言充满行话、品牌造词和语境依赖的隐含关系。在垂直领域语料上做适配是必要步骤,直接套用通用模型效果会打折。
知识图谱的价值也高度依赖下游任务的设计。图谱本身只是结构,能不能在 AI 产品里发挥作用,取决于检索、编排和生成模块是否知道怎么用它。把图谱理解为 AI 推理时可调用的外部记忆,而不是 AI 的「大脑」,才不会对它有不切实际的期待。
分类
全部
发布日期
2026-08-14
阅读时间
7 分钟阅读
相关推荐

发散推理模型:探索、评估与收敛

Context System、RAG 与知识图谱:企业记忆的三种建法
