大模型“内卷”结束,企业AI下半场在主观世界模型

WAIC 上特赞提出主观世界模型 SWM,四层架构建模消费者真实决策逻辑,联动 GEA 企业智能体落地业务,独家深访数据构筑高壁垒,开启企业 AI 新赛道。

2026 年世界人工智能大会(WAIC)于 7 月 17 日在上海开幕。本届大会规模创历届之最,Agent 成为产业侧最集中的叙事主轴——从算力基础设施到自主执行系统,各方对"AI 能干什么"的讨论已相当充分。

在 Agent 的主流叙事之外,我们发现了一个有趣的角度,它或许是AI发展的另一个方向——主观世界模型。这个概念也出现了央视新闻直播间,提出者是同济大学教授范凌,他也创办了特赞这家公司。

这个模型的特点是,让AI 开始理解人——不只是生成语言,而是建模一个具体个体的心理结构、决策逻辑和行为倾向。他将特赞正在研究的这套系统称为"主观世界模型"(Subjective World Model,SWM)。

这个概念随后在 WAIC 展台引发了密集追问,和人们熟悉的 LLM 范式有足够大的差异。

记者来到展台一探究竟,本文希望系统梳理 SWM 的技术路径、数据架构与竞争壁垒。

LLM的结构边界

过去三年,大语言模型在企业应用层的渗透速度超出预期。内容生成、代码辅助、知识检索、客服自动化——这些场景的共同特征是:任务的核心是语言输出,而非理解一个具体的人。

当应用场景从"生成合理文本"转向"理解消费者决策"时,LLM 的结构性边界开始显现。

LLM 的预训练目标是 next-token prediction:在给定上下文后预测下一个 token 的概率分布。经过几万亿 token 的训练,模型建立了对人类语言统计规律的高质量近似。这使它能流畅地完成语言层面的任务,但它建模的是语言本身,而非语言背后那个说话者的心理结构。

这一边界在品牌决策场景中尤为突出:消费者的购买动机、价值权重、风险偏好,以及自我报告与真实行为之间的系统性偏差,都不在 LLM 的建模目标之内。用 LLM 生成的用户画像,本质上是语言统计的投影,而非消费者心理的建模。

主观世界模型的技术路径

主观世界模型(SWM)是特赞科技针对上述边界独立设计的模型架构,是其消费者研究平台 Atypica 的底层技术框架。

SWM 的核心主张是:将"建模一个人的主观世界"作为独立的训练目标,而非 LLM 的微调或领域适配。其训练目标、数据体系与评估方式均与 LLM 体系相互独立。

架构设计:四层协同建模

SWM 将"消费者主观世界"拆解为四个可独立建模、协同推理的层次:

Expression Layer(表达层)

训练数据为数十亿条社交平台原生语料,建模目标是语言风格与 demographic/psychographic 信号之间的高维映射关系。

同一消费者立场在不同群体间呈现系统性不同的语言编码——词频分布、情绪强度、隐含价值判断均随身份变量发生可预测的偏移。表达层的任务是从语言表层反向推断说话者的身份结构和心理特征,为后续层次提供个体识别基础。

Story Layer(叙事层)

训练数据为数万小时一对一深度访谈,每次访谈时长 1-2 小时,产生 5,000-20,000 字非结构化语料。建模目标是行为动机的时序因果结构。

问卷数据与深度访谈数据之间存在根本性的信息密度差异:问卷捕捉的是静态偏好向量,深访捕捉的是动机链——个体在特定情境下接触产品、形成考虑意向、触发决策的完整时序结构,以及购买后的自我解释机制。后者包含前者无法提取的因果信息。

叙事层数据具备三重不可复制性:其一,不可爬取——互联网上缺乏此类高密度、一对一的消费者行为叙述;其二,不可合成——LLM 生成的模拟访谈数据会在认知层和行为层的交叉验证中系统性失真;其三,不可速成——数据积累依赖长期的客户服务关系与专业研究能力,特赞的叙事层语料来自十年间 180+ 家企业客户的消费者研究项目。

Cognition Layer(认知层)

训练数据包括行为判断问卷和标准化心理学量表(Schwartz 价值观量表、BFI 人格量表等),建模目标是个体真实的价值权重体系与风险偏好系数。

认知层存在的核心依据是自我报告偏差——个体的表达偏好与真实决策权重之间存在可测量的系统性差距。认知层用于建模并校正这一差距,使模型不依赖消费者的自我报告,而是还原其真实的决策权重结构。

Behavior Layer(行为层)

训练数据为经济博弈实验(ultimatum game、public goods game 等)和真实交易记录,建模目标是行为经济学参数:损失厌恶系数(loss aversion coefficient)、时间贴现率(temporal discounting rate)、社会规范敏感度(social norm sensitivity)等。

行为层解决的是跨情境迁移问题:当模型面对训练数据中未出现过的新场景,需要基于个体层面跨情境稳定的参数推断反应,而非退化为通用描述。

合成数据替代路径为何不可行

"以 LLM 合成深访语料替代真实数据采集"是降低叙事层数据成本的直接思路,也是 SWM 架构设计主动防御的核心方向。

合成语料在表达层验证中表现良好——LLM 生成的文本在语言风格上具备高度仿真能力。但在认知层和行为层的交叉验证中,合成数据会系统性失败。

真实受访者的叙述具有跨情境一致性:个体的核心价值权重(如风险厌恶倾向)会以不同形式贯穿于不同购买场景的叙述中,形成内在一致的"心理签名"。LLM 在生成过程中并不维护一个持续的内在状态,而是在每次生成时独立预测最合理的 token——因此合成的"受访者"缺乏跨场景的价值权重一致性。

认知层的交叉验证机制会检测并过滤这种不一致,使合成数据无法进入模型训练。这一机制同时也保证了真实数据积累的竞争壁垒不会被合成手段绕过。

量化指标与实际部署

四层协同训练后,SWM 输出 AI Persona——在任意新提示下能维持内在一致心理结构、价值权重、情绪反应和决策倾向的数字个体。

当前已公开的量化结果:

-行为模拟准确率:85%(对比真人深访基准)

-覆盖规模:30 万+ AI Persona(社交数据来源)、1 万+ 高精度 AI Persona(深访数据来源)

-交付周期:< 30 分钟(对比传统消费者研究 4-8 周)

SWM 目前作为 Atypica (特赞科技研发的洞察研究智能体产品)的底层架构,已在全球 180+ 家企业客户的真实业务场景中完成部署验证,覆盖快消、科技、汽车、零售等行业。

SWM与GEA的架构协同

SWM 解决的是理解侧的问题——对消费者主观世界的结构化建模。消费者洞察的商业价值实现,依赖其向业务执行的有效转化。谁来负责转化?

特赞 GEA(Generative Enterprise Agent)就是具体承接这一转化链路的答案。

GEA 是特赞自研的四层企业级智能体架构:意图层负责结构化解析业务目标;编排层由特赞自研的发散推理模型(Creative Reasoning Model)驱动,单次任务可协调 30+ 基础模型;技能层提供 400+ 模块化专业技能;上下文层(Context System)沉淀企业知识、品牌 DNA 与历史洞察,持续可调用。

SWM 输出的消费者洞察经由 Context System 与企业历史数据结合,形成从消费者理解到业务执行的端到端闭环。GEA 已在全球 50+ 个国家和地区完成部署,月均 Token 部署量超 100 亿。

竞争壁垒的结构分析

从竞争格局角度,SWM 的壁垒由四层叠加构成:

数据壁垒:叙事层深访数据的十年积累,不可爬取、不可合成、不可速成,是最核心的单点壁垒。

验证壁垒:认知层和行为层的交叉验证机制,系统性堵死了合成数据的替代路径,使数据壁垒具有可持续性。

规模壁垒:30 万+ AI Persona 的覆盖规模,使单次研究能达到传统方法在时间和成本约束下无法实现的细分粒度。

部署壁垒:180+ 家企业客户在真实业务场景中的验证积累,形成了行业覆盖深度和场景密度上的先发优势。

结语

消费者研究的历次技术代差——从焦点小组到问卷平台,从 NLP 到情感分析——都是在"更高效地收集消费者说了什么"这一维度上的进步。SWM 试图跨越这一维度,直接建模"消费者为什么这么做、下次会怎么做"。

从技术路径看,这件事在当前是可做的。从数据壁垒看,先行积累十年的优势已经形成。Atypica 也已经验证了这一技术框架的完整产品化落地的可行性。

AI 供给侧能力的商品化进程仍在加速,企业 AI 竞争的下一个分化维度,将取决于谁对消费者的理解更深——而这种理解能力的建立,不能被 API 化,不能被平台化,只能被积累。

对这一方向感兴趣的读者,WAIC 期间可前往特赞展台(H1-C135)现场体验 Atypica 的 demo,直接与产品交互是理解 SWM 实际效果的最直接方式。展览持续至 7 月 20 日。

(来源:微信公众号 虎嗅智库)

分类

媒体报道

发布日期

2026-07-21

阅读时间

13 分钟阅读

分享本页

相关推荐

围观WAIC模型「读心术」!现场火火火火火
媒体报道2026-07-22

围观WAIC模型「读心术」!现场火火火火火

AI落地:七成难题不在技术本身,而是人的组织
媒体报道2026-07-22

AI落地:七成难题不在技术本身,而是人的组织

WAIC2026首日,打卡过这些展位你才知道为何“一票难求”
媒体报道2026-07-22

WAIC2026首日,打卡过这些展位你才知道为何“一票难求”