# 智研网比赛真实案例数据审计

## 结论

这份精准母包可作为官网真实案例的数据底座。三条分析链均能回溯到同一批 222 条 Multi-Agent 可观测文本记录。

- BERTopic：222/222 通过 `unit_index` 与原始行顺序精确一致；29 个实质主题 + 1 个离群类别记录，离群文本 5 条（2.25%）。
- 情感分析：两个 run 共 444 条预测均与原始 `text + unit_id` 逐条一致；元数据可由 `metadata_json.raw` 完整恢复。
- 扎根分析：81 个分段、67 个最终 active code、316 条 coding、12 个 category、11 条主轴关系、2 条 memo。268/316 条 coding（84.8%）可用证据片段精确定位回某一条原始 Multi-Agent 记录。

## 需要在官网保留的真实性边界

1. **情感分析不应把“96.8%负面”直接宣传为稳定研究发现。** 修复 run 自身触发 `label_distribution_collapse` 质量预警。更适合展示“算法输出 + 自动质量告警”的透明分析过程。
2. **扎根分析没有达到程序定义的理论饱和阈值。** `saturation_segment_index = null`，因此不能写“已达到理论饱和”。
3. 扎根工具导入时把原始行序列化成文本后再切成 81 个片段，顶层 group/arm 字段为空；本包只对能通过证据片段精确定位的 coding 恢复群体/实验臂归属，不对其余记录强行归因。
4. Multi-Agent 两实验臂在第5轮正式纠偏前已经出现随机轨迹差异，所以图表只写“描述性差异”“干预关联”，不写严格因果“处理效应”。

## 官网可直接使用的强结论

- 研究语料在 BERTopic 中形成 29 个实质主题，核心讨论持续围绕来源核验、原始研究追溯、方法学证据、社群协作与核验责任展开。
- 扎根分析的核心范畴为：**证据缺口下的社群协作核验与审慎采纳**。
- 最终 67 个 active code 中，高频编码包括“指出信息缺乏可验证来源”“提出系统化的文献检索与同行评议核验方法”“倡导社群共同检索原始研究”“要求具体方法学证据作为评估前提”等。
- 11 条主轴关系构成从“证据缺口”到“协作核验—责任明确—审慎采纳”的机制链。

## 官网数据文件

- `01_case_master_222.csv`：每条 Multi-Agent 文本 + BERTopic + 两轮情感 + 可用干预触达信息。
- `06_扎根编码引用_溯源映射.csv`：316 条 coding 的真实来源追踪状态。
- `07_扎根最终67编码_频次与类别.csv`：最终 active code 及真实频次。
- `08_扎根11条主轴关系.csv`：主轴关系原始记录。
