正在准备独立研究工作区
系统会自动建立草稿项目,不需要先填写项目名称。
研究流程
导入语料后运行 BERTopic 主题建模;系统保留清洗结果、参数、主题、文本归属、离群文本和图表。运行失败时显示真实原因和调参建议,不自动改写文本、不生成伪结果。
标准输出路径
主题输出规则
用户侧统一显示“T01 · 可读主题名”。核心术语、原始 c-TF-IDF 词、代表文本分层保留。不会把 Topic 1、主题 1 或“待人工命名主题”直接展示给用户。
标准输出
主题总表、文本与主题归属、离群文本、预处理与术语表、方法与复现记录,以及主题距离、关键词、热力图、层级图、文本分布等图表。
数据与预处理
导入 TXT、Markdown、CSV、XLSX、DOCX、PDF。表格资料建议填写文本列和时间列;时间列用于趋势与桑基图,未选择时间列时相关图表会保持禁用。
导入资料
支持 TXT、Markdown、CSV、XLSX、DOCX、PDF。表格文件可指定正文列;普通 TXT 不需要填写文本列。
已导入资料
研究成果会按标准 Corpus View 导入,不再分析运行JSON字段。BERTopic 建模
选择语料后运行 BERTopic。系统通过平台语义向量服务生成向量,并按真实文本和参数建模;运行异常时仅向普通用户提供可操作的处理建议,具体服务端技术详情仅在管理后台保留。
实验版本
每次运行独立保存。建模后输出
完成后前往“主题结果”查看主题总表、文本归属、离群文本、代表文本和原始词审计;如果运行失败,系统会给出可操作的错误说明与调参建议;服务端技术详情仅在管理后台保留,不会生成伪结果。
主题结果
主题、文本归属、离群文本和术语分开呈现。主题编号仅用于定位,显示时始终与可读主题名一起出现。
图表解读
论文图只读取当前实验已经生成的标准 CSV 结果集,不重新读取原始语料,也不读取大型 JSON / artifacts。首次打开某张图时只生成这一张并缓存 SVG / PNG,之后直接复用成品图。
导出与复现
本次运行只维护一套标准 CSV 结果集:它既用于结果下载,也用于论文图复现。论文图只读取这些 CSV 生成 SVG / PNG,不重新读取原始语料或大型 artifacts;API Key 不会写入数据库或导出文件。