流程总览
平台的核心流程可以理解为两段:先通过数据质量控制得到可靠的数据格式,再把这些数据送入各个分析模块。数据清洗越认真,后面的聚类、关联规则和网络结果越容易解释。
数据准备
开始前先把 Excel 整理好。平台可以提高效率,但不能替代研究者对原始数据的核对和判断。
内含原始方剂表、清洗规则、宽数据和剂量数据 4 个工作簿,可用于熟悉各模块上传格式。
剂量数据
- 剂量建议使用整数,单位无需写入单元格,不需要录入“g”。
- 古代剂量、体积、个数、颗粒剂、粉剂等需要先由研究者转换或说明口径。
- 没有剂量时不要补 0,直接不录入剂量即可,也无需做剂量分析。
登录与入口
平台首页提供统一登录。登录后可直接进入已获授权的数据分析模块,不需要在各个应用里重复登录。
使用结束后建议登出,尤其是在公共电脑或多人共用设备上。
匹配字段与数据清洗
匹配字段
匹配字段用于快速发现潜在的非标准名称,包括中药、证候、症状、诊断、治法、穴位等。上传文件后,系统会统计字段频数,并把标准库未覆盖的字段列出来。
- 上传原始 Excel,选择对应的数据清洗类型。
- 查看“待规范”字段,判断它是错别名、别称、不常用标准名,还是确实无需规范。
- 下载待清洗字段表,在标准字段列填入要替换成的名称。
- 无需保留的字段可以留空,或从清洗规则中删除。
数据清洗
数据清洗页面需要同时上传原始数据和清洗规则。点击清洗后,先看提示信息,再下载清洗后的数据,并继续转换为宽格式。
- 如果提示同一行有重复字段,需要回到原始数据或清洗规则中修正。
- 转换为宽数据前,确认没有空列、重复字段或剂量异常。
- 宽数据是后续属性功效、聚类、关联规则、处方相似度和共现网络的常用输入。
- 清洗后的原始格式数据可用于剂量分析和综合分析。
数据分析模块
完成字段匹配、数据清洗和宽数据转换后,就可以进入“数据分析”应用。下面的截图使用平台测试宽数据 内服中药宽数据-测试.xlsx 跑出,包含 297 条处方记录、177 个中药字段,图片不是手绘示意图,而是调用平台同一套分析函数得到的真实输出。
包含宽数据预览、关联规则探索表、正式规则表、Phi 相关矩阵和处方相似度表,可与页面截图互相核对。
中药属性与功效分析
从“中药属性与功效分析”到“共现网络”,都使用宽格式数据。该模块用于查看四气、五味、归经、一级功效、二级功效等分布。
聚类分析
聚类分析用于观察字段之间是否经常一起出现。原使用说明特别强调:平台基于 Phi 相关系数进行聚类与可视化,不再沿用传统层次聚类直接处理 0/1 数据的思路。
关联规则
关联规则用于回答“出现 A 时,是否经常同时出现 B”。原使用说明把它拆成两步:先探索不同支持度、置信度组合下的规则数量,再选择参数进入正式分析。
处方相似度
处方相似度使用 Jaccard 系数比较两个处方的组成接近程度。它适合发现高度相似的方剂、重复或近重复记录,也可以用来寻找处方群。
共现网络
共现网络用于展示中药之间的共同出现关系。平台会把 degree 值、共现次数和功效分类映射到节点、连线、颜色等视觉元素上。
剂量分析与综合分析
剂量分析和综合分析不使用宽数据,而是使用清洗后的原始格式数据。剂量分析关注中药剂量占比与分布;综合分析用于组合 2 到 4 个维度观察流向关系。
结果解读建议
- 不是所有数据都能挖掘出理想核心方。专家经验方、临床医案、专利数据、少数民族医药数据的规律强弱可能差异很大。
- 处方相似度高的红色区块较多,通常说明方剂组成更接近;若同时有症状或证候数据,可以进一步提取对应方剂做临床解释。
- 关联规则建议先看规则数量分布,再选一组能解释、数量适中的支持度和置信度。
- 共现网络的功效分类不宜过多。分析 30 个左右字段时,一级功效最好控制在容易解释的数量范围内。
- 平台结果应服务于研究问题,不能只看图好不好看。参数选择、字段删留和标准化口径都需要在论文方法中说明。
常见问题
为什么清洗后还要再匹配一次?
因为替换规则可能让同一行出现新的重复字段,也可能暴露前一轮没有注意到的异常名称。再次匹配可以减少后续转换失败。
为什么宽数据转换失败?
最常见原因是同一行存在重复元素、空列、异常符号或清洗规则留空导致生成 NA 列。先回到清洗结果检查最后几列和提示信息。
关联规则多少条比较合适?
没有固定答案。实践上可以先让规则数落在便于阅读和解释的范围,再结合研究问题微调支持度和置信度。
引用与方法
平台主要分析由 R 语言和成熟统计可视化程序包实现。写作论文时,建议说明数据清洗口径、字段标准化规则、支持度与置信度选择、聚类参数、相似度指标和网络筛选条件。
- 关联规则:arules、arulesViz、ggplot2。
- 聚类与热图:Phi 相关系数、pheatmap 等。
- 共现网络:ggplot2、ggraph 等。
- 处方相似度:Jaccard 系数。
推荐引用:Dan W, Guo X, Zhang G, Zhang H, Liu J, Li Q, et al. SinoMedminer: an R package and shiny application for mining and visualizing traditional Chinese medicine herbal formulas. Chin Med. 2025;20:80.