SocialSim
返回研究工作台
LLM-DRIVEN AGENT-BASED SOCIAL SIMULATIONv1.6 · Research Preview

从社会理论出发,
让传播仿真变得可验证、可解释、可复现

SocialSim 是面向传播学、社会学与计算社会科学的研究工作台。系统把真实社交媒体证据、人口与群体结构、经典传播机制、真实云端 LLM 决策和经验验证放在同一条可审计链路中,帮助研究者从“描述传播现象”进一步走向“提出机制假设、运行受控实验并检验解释力”。

LLM + ABM自然语言认知代理与机制模型结合
1,000 Nodes已完成个体网络真实模型基准
10 Runs多次重复与 bootstrap 区间
Evidence First质量门、审计、Benchmark 与 holdout
Background & Vision

项目背景与核心愿景

SocialSim 起源于一个方法论问题:社会传播研究如何既保留理论机制的可控性,又容纳真实语言、异质人群和复杂互动,同时不把模型输出误当成现实真相?

传统 ABM 的表达能力有限

规则型主体便于控制,却常把人的理解、犹豫、质疑和情绪压缩为少数阈值,很难处理真实刺激文本和复杂语境。

单独使用 LLM 缺少社会结构

大模型可以生成自然语言判断,但如果没有人口分布、网络位置、传播机制、重复实验和质量门,输出难以形成可检验的社会科学解释。

真实数据与仿真往往彼此割裂

许多系统只能演示扩散曲线,却不能说明参数从何而来、与真实事件拟合多少、哪些机制有贡献,以及结论能否在 holdout 窗口泛化。

核心愿景:建立可证伪的社会仿真实验

不是让模型“讲一个看起来合理的故事”,而是把研究问题、数据来源、机制选择、模型调用、参数变化、拟合指标和局限全部留下证据,让结论可以被复核、质疑和重复。

长期方向:连接理论、数据与干预评估

逐步形成从真实平台数据接入、事件校准、机制消融、策略干预到跨事件比较的开放研究基础设施,为论文研究、公共传播和商业传播实验提供共同方法底座。

“SocialSim 的目标不是替代现实调查,而是把不可控的现实传播问题转化为可记录、可比较、可验证的计算实验。”项目方法论定位
Research Principles

六项设计原则

01

研究有效性优先

宁可中止,也不将 API 失败、Mock 或规则兜底包装成真实 LLM 仿真结果。

02

人类研究者最终确认

AI 审查只提出结构化建议;研究问题、数据、刺激和真实性门槛不能被后台静默修改。

03

证据链可追溯

保存配置、哈希、Prompt、模型、机制、参数、审查、编码版本、拟合报告和证据等级。

04

仿真与现实保持边界

合成 Baseline 只用于演示;只有通过数据与编码质量门的真实观测才能成为经验 Benchmark。

05

隐私最小化

凭证按账户加密;Benchmark 不保存用户名和原文,actor ID 哈希,原文只在受控分析阶段瞬时使用。

06

成本与规模透明

展示调用预算、并发、Token 与预计费用;段级 LLM 决策避免按每个个体节点重复调用。

Two Core Workspaces

两个相互连接、又能独立使用的核心模块

仿真实验负责受控机制实验,真实数据校准负责经验依据与参数检验。校准参数只有在研究者确认后才会进入仿真配置。

01

仿真实验工作台

回答“在给定人群、网络、信息和机制条件下,可能出现怎样的传播过程?”

  • 人口数据、合成 Baseline 与群体 Agent 构建
  • 研究问题、刺激文本、事件时间线和信息属性
  • 网络拓扑、经典机制与 User Engagement 闭环
  • 真实云端 LLM 决策、评论与逐轮 WebSocket 进度
  • AI 实验审查、预算与真实性质量门
  • 多 run 结果、历史恢复、验证报告与导出
02

真实数据校准工作台

回答“真实事件提供了什么证据,哪些机制和参数与这些证据更一致?”

  • 帖子/评论接入、去重、时间窗和父帖关联检查
  • 用户画像、事件目录与隐私合规检查
  • 相关性、立场、大情绪、细粒度情绪和极化编码
  • 主题聚类、表情语义空间与数据质量分析
  • 经验 Benchmark、机制映射、消融和 optimizer
  • calibration/holdout 分离、证据等级与参数交付
Core Capabilities

核心能力全景

人口与群体建模

按教育、收入、性别、媒介习惯、信任等维度构建群体原型,并区分群体数与个体网络节点数。

多种网络拓扑

支持无标度、小世界、随机和社区网络,输出节点状态、连边结构和逐轮网络快照。

可组合传播机制

SIR、沉默螺旋、意见领袖、阈值、弱关系、引爆点、DeGroot 与互动机制可组合和消融。

真实云端 LLM

账户独立配置 DeepSeek、阿里云百炼、火山方舟与 Agent Plan,启动前执行凭证和模型预检。

User Engagement

模拟点赞、评论、转发、参与状态、账号信誉和公开舆论摘要,使互动结果反作用于后续传播。

AI 实验审查

程序检查、一次 AI 方法审查和最终复核共同生成差异表,配置哈希防止过期建议被错误应用。

真实数据内容分析

区分相关与题外内容,分析立场、情绪、极化、主题和表情共现,并保留方法与版本说明。

经验校准与验证

使用 RMSE、DTW、JS 散度、峰值误差、bootstrap 区间和透明拟合总分连接真实与仿真。

实时运行与逐轮回放

WebSocket 推送决策、帖子、互动、网络、Token 与成本;运行后可同步回放网络、事件和群体轨迹。

三类研究看板

分别展示仿真结果、真实世界拟合和独立数据集评估,避免不同证据层次混在一张图里。

多用户隔离

实验、Benchmark、校准工作区、WebSocket 和四类模型凭证均按账户隔离。

{ }

可复现与论文导出

保存完整配置与审计元数据,支持历史加载、回放 JSON、轨迹/事件 CSV、网络 SVG、论文 PNG 与 GEXF。

End-to-End Workflow

从真实证据到仿真实验的完整链路

数据接入
质量检查
态度与情绪编码
经验 Benchmark
机制与参数校准
LLM-ABM 仿真
经验验证与报告

仿真实验七步

  1. 数据源与 Baseline
  2. 群体 Agent 与参与账号
  3. 研究问题、刺激与事件设计
  4. 网络、理论机制与校准参数
  5. 波次、run、并发、预算与质量门
  6. 程序检查和可选 AI 审查
  7. 真实模型运行、实时观察和结果分析

真实数据校准七步

  1. 数据接入与标准化
  2. 数据范围、画像和关联检查
  3. 相关性、态度与情绪编码
  4. 内容分析与质量评估
  5. 经验 Benchmark 构建
  6. 机制映射与消融诊断
  7. optimizer、holdout 和参数交付
Research Dashboards

三类看板对应三种不同问题

看板分开呈现“模型发生了什么”“与现实拟合得怎样”和“数据本身是否可靠”,避免把仿真表现误写成现实准确率。

DASHBOARD A

仿真结果与事件回放

传播趋势、群体差异、网络状态、帖子/互动时间线与信誉轨迹使用同一波次游标;节点、轨迹和事件可联动选择。

DASHBOARD B

真实世界拟合看板

真实/仿真叠加曲线、MAE、RMSE、归一化 DTW、互动与立场 JS 散度、峰值误差、置信区间和拟合总分。

DASHBOARD C

数据集评估看板

数据来源、许可、时间窗、记录关联、隐私、题外率、编码覆盖率、情绪、极化、主题、表情语义和可计算指标。

Content Analysis Schema v4

态度之外,进一步理解情绪、极化、主题与表情

相关性门

relevant / irrelevant / uncertain 先于立场判断。题外内容保留为数据质量证据,但不进入立场 Benchmark。

双层情绪

大情绪保留正向、负向、中性、混合;细粒度覆盖喜悦、愤怒、悲伤、恐惧、厌恶、惊讶、信任、期待和平静。

两种极化

单条文本记录表达极端强度;总体指标结合支持/反对阵营平衡度与方向性参与率,不把极化误解为正负情绪。

主题与表情语义

关键词 TF-IDF 自动聚类主题;微博 [表情] 和 Unicode emoji 按立场/情绪共现,经 SVD 投影为事件内语义空间。

历史 Schema v3 没有显式相关性和情绪字段。系统可以用理由启发式和本地情绪词典生成探索性预览;论文级结论应使用 v4 重编码,并报告人工标注一致性、跨模型一致性和敏感性检验。

Research Scenarios

适用研究场景

重大公共事件与舆论传播

研究信息触达、立场变化、情绪升级、意见领袖和沉默螺旋,以及不同回应策略可能产生的传播差异。

商业新品推广与品牌传播

比较目标受众、媒介组合、种子账号、刺激文本和网络机制对口碑、互动和扩散效率的影响。

谣言、辟谣与风险沟通

考察来源可信度、事实核查、弱关系传播、阈值与用户信誉闭环对谣言扩散和纠偏的作用。

健康与公共政策传播

在不同人口群体、机构信任和媒介习惯条件下,测试健康信息与政策沟通的接受、质疑和转发路径。

平台互动与群体极化

分析点赞、评论、转发反馈如何改变内容可见性、公开舆论感知、账号行为和阵营结构。

教学、方法复现与基准比较

使用合成 Baseline 演示完整研究流程,再接入真实事件进行 calibration/holdout、消融与跨事件比较。

Architecture & Deployment

单一后端、双工作台、云端推理

合并版以一个 FastAPI 进程承载仿真与校准 API,复用 JWT、用户凭证、存储和前端。浏览器通过 REST 配置实验,通过账户隔离 WebSocket 获取逐轮事件。云端 LLM 使 Ubuntu 服务器无需 GPU;1,000 节点基准已在单 worker 环境跑通。

真实帖子 / 评论 ─→ 标准化与隐私检查 ─→ 相关性 / 立场 / 情绪编码 ─→ 经验 Benchmark │ │ └─→ 用户画像与真实信号 ─→ 机制诊断 ─→ optimizer ─→ calibration / holdout │ 人口与群体 Agent ─→ 网络与传播机制 ─→ 云端 LLM 决策 ─→ 逐轮帖子 / 互动 / 信誉 / 网络 │ 仿真实验存档 ←──────────────┘ │ 真实 Benchmark ───────────────────→ 经验验证报告与三类结果看板
任务运行位置GPU说明
清洗、关联、Benchmark、指标本地 Ubuntu 或部署服务器不需要Python / NumPy / NetworkX CPU 计算
主题聚类、极化、表情 SVD后端本地内存当前不需要只向前端返回聚合结果,不返回原始正文
DeepSeek 内容编码云端 API本机不需要由账户凭证触发,版本变化时重新编码会产生 Token 费用
LLM-ABM 主体决策云端模型本机不需要后端组织并发、预算、重试与有效性门槛
1,000 节点结果回放服务器存档 + 浏览器渲染不需要单次正式基准结果约 63 MB;下一阶段将增加按 run 懒加载、压缩与 Canvas/WebGL
Version History

从 MAS-SD 原型到统一研究工作台

版本号表示研究功能阶段,不代表所有方法已经达到最终论文级证据。当前版本仍是持续开发中的 Research Preview。

MAS-SD · 概念原型早期阶段

建立多智能体社会传播的基础结构,验证人口分群、传播机制和网络仿真的可行性。

SocialSim v1.0–v1.2仿真平台阶段

形成七步实验向导、群体 Agent、经典传播机制、云端 LLM 决策、实时 WebSocket 与基础结果看板。

SocialSim v1.32026-07-17

升级为学术研究工作台:加入 User Engagement、AI 实验审查、每账户模型凭证、合成 Baseline、经验 Benchmark、验证指标和历史可复现存档。

SocialSim v1.42026-07-19

合并真实数据校准子系统:新增微博摄取、画像、云端立场编码、机制映射、消融、optimizer、holdout、网络比较与校准参数回流。

SocialSim v1.52026-07-20

统一双工作台和三类看板;修复数据关联与样本链路;加入 Schema v4 相关性、双层情绪、表达极化、主题聚类、表情语义空间,以及独立项目简介。

SocialSim v1.62026-07-21当前版本

建立 socialsim-replay/v1 回放协议,加入逐轮网络动画、帖子/互动时间线、群体轨迹、真实/仿真波次联动和论文图表导出;完成 1,000 节点、2 波、10 runs 的真实 DeepSeek 冻结参数基准与 holdout 验证。

下一阶段:大规模可视化与结果传输

节点超过约 2,000 时切换 Canvas/WebGL,增加事件虚拟列表、社区折叠、按 run/波次懒加载、响应压缩和真实/仿真结构指标联动。

中长期:论文级复现与平台化

用户可控随机种子、真正配对消融、final confirmation、calibration/holdout 自动化、数据连接器、任务队列、多 worker 和跨事件 Benchmark。

Validated Research Milestone · 2026-07-20

首套 1,000 节点冻结参数经验基准

使用 ai_face 真实事件、冻结校准参数、9 个群体原型、1,000 个体节点、2 波与 10 次独立运行。全部运行使用已验证的真实 DeepSeek 云端调用,未启用机制兜底。

1,000每轮个体网络节点
10 / 10重复运行完整完成
99.1%219 / 221 有效 LLM 调用
83.67%跨 run 结果一致性
53.7holdout 拟合总分,不是 Accuracy
100%验证指标覆盖率
64,832实际 Token 统计
84 / 84自动化测试通过

本次实验逐轮保存 1,000 节点与 1,996 条边,共生成 6,072 条互动和 97 条仿真帖子;holdout 报告包含 10 runs 的均值、标准差与 95% bootstrap 区间。

53.7 是特定事件、受众分母、时间分箱、指标公式和冻结参数下的“拟合总分”,不是现实预测准确率。真实触达约 1.3%,仿真两波平均触达约 44.9% / 74.8%,尺度偏差仍明显;1,000 个体节点也由 9 个群体原型派生,不等同于真实 5,929 个 actor。当前参数证据等级仍为 screening,随机种子与 final confirmation 尚待补齐。

Boundaries & Responsible Use

系统明确不做什么

不是现实事件预测器

拟合总分不是 Accuracy,仿真结果表达的是给定假设下的模型行为,不能直接当作真实社会结果。

不替代调查与人工编码

LLM 标签需要抽样复核、Cohen's kappa、跨模型一致性和误差分析;本地词典情绪只属于探索性预览。

不保存不必要的个人信息

Benchmark 禁止用户名和原文,图表不返回源文本;接入真实数据前应确认采集许可、用途和存储周期。

不允许 AI 静默改实验

研究问题、刺激、数据和真实性门槛由研究者控制;AI 建议需要哈希校验和明确确认。

不隐藏失败与不确定性

API 错误、无效响应、样本不足、指标缺失、旧 Schema 和证据等级都应在界面与报告中显示。

不宣称未经验证的因果效应

机制消融和参数拟合提供模型内证据;因果结论还需要配对随机种子、充分重复、预注册和外部验证。