SinoMedminer 站内使用教程
使用指南2 · 站内版

SinoMedminer 平台使用教程

这份教程根据原“使用指南”的工作流重新整理,并补充当前站点的登录与数据分析使用路径。重点是让用户知道先整理什么数据、上传到哪个模块、如何判断结果是否适合继续分析。

SinoMedminer 首页上的使用指南2按钮截图
图 1:首页已新增“使用指南2”入口。原外站“使用指南”保留,新教程页在站内打开,加载更快,也便于后续持续维护。

流程总览

平台的核心流程可以理解为两段:先通过数据质量控制得到可靠的数据格式,再把这些数据送入各个分析模块。数据清洗越认真,后面的聚类、关联规则和网络结果越容易解释。

wolai 使用说明中的平台流程总览截图
图 2:原使用说明中的真实流程总览。左侧是数据质量控制,右侧是模块分析;后续教程按这个顺序展开。
1
整理原始 Excel一类数据放一个工作表,第 1 列是 id,每个诊疗元素占一个单元格。
2
匹配字段找出潜在非标准字段,下载待清洗字段表,补充标准名称或删除无需保留的字段。
3
数据清洗上传原始数据和清洗规则,检查重复字段、异常符号、剂量格式,再导出清洗后的数据。
4
转换宽数据多数分析模块使用宽数据。剂量分析和综合分析更常使用清洗后的原始格式数据。
5
开展分析与解读按研究目的选择属性功效、聚类、关联规则、处方相似度、共现网络、剂量或综合分析。

数据准备

开始前先把 Excel 整理好。平台可以提高效率,但不能替代研究者对原始数据的核对和判断。

下载测试数据

内含原始方剂表、清洗规则、宽数据和剂量数据 4 个工作簿,可用于熟悉各模块上传格式。

下载 .xlsx
文件格式 使用 .xlsx 文件。默认读取第 1 个工作簿,正式上传前请确认第 1 个工作簿就是要分析的数据。
第 1 列为 id 每一行必须有唯一标识。没有真实编号时,可用 id_1、id_2 这类规则编号。
一个单元格一个元素 中药、症状、证候、诊断、治法等字段都建议一格一个,避免把多个字段挤在一个单元格里。
去掉干扰字符 清理空格、换行符、括号、波浪线、短横线和混乱标点。中文数据建议删除全部空格。
如果整张表里存在空列,或者同一个处方内重复出现同一个中药,后续宽数据转换很可能失败。清洗后建议再跑一次字段匹配,确认没有新的异常字段。
Excel 分列后的中药数据截图
图 3:原使用说明中的 Excel 分列示例。把一个单元格里的多个中药拆成多个单元格,后续才方便检查和上传。
原使用说明中的无剂量中药数据格式截图
图 4:原使用说明中的无剂量数据格式。第 1 列为编号,后面每个单元格放一个中药名。
原使用说明中的含剂量中药数据格式截图
图 5:原使用说明中的含剂量数据格式。剂量直接跟在药名后,单位和换算口径需要在上传前统一。
Excel 查找替换清理换行符截图
图 6:原使用说明中的 Excel 查找替换示例。换行符、异常标点和空格建议在上传前统一清理。

剂量数据

  • 剂量建议使用整数,单位无需写入单元格,不需要录入“g”。
  • 古代剂量、体积、个数、颗粒剂、粉剂等需要先由研究者转换或说明口径。
  • 没有剂量时不要补 0,直接不录入剂量即可,也无需做剂量分析。

登录与入口

平台首页提供统一登录。登录后可直接进入已获授权的数据分析模块,不需要在各个应用里重复登录。

首页登录注册弹窗截图
图 7:首页登录/注册弹窗。登录后点击“数据分析”会直接进入对应模块。
原使用说明中的登出按钮截图
图 8:原使用说明中的登出入口提示。使用公共电脑或多人共用设备时,使用后建议登出。
数据分析 从首页点击“数据分析”,进入方剂数据挖掘应用,完成字段匹配、清洗、属性功效、聚类、关联规则等分析。

使用结束后建议登出,尤其是在公共电脑或多人共用设备上。

匹配字段与数据清洗

匹配字段

匹配字段用于快速发现潜在的非标准名称,包括中药、证候、症状、诊断、治法、穴位等。上传文件后,系统会统计字段频数,并把标准库未覆盖的字段列出来。

  1. 上传原始 Excel,选择对应的数据清洗类型。
  2. 查看“待规范”字段,判断它是错别名、别称、不常用标准名,还是确实无需规范。
  3. 下载待清洗字段表,在标准字段列填入要替换成的名称。
  4. 无需保留的字段可以留空,或从清洗规则中删除。
匹配字段页面操作截图
图 9:原使用说明中的“匹配字段”页面。上传文件后先查看待规范字段,再下载待清洗字段表。
字段频数统计页面截图
图 10:字段频数统计示例。频数可以帮助判断哪些字段值得优先规范。
原始字段含异常字符的截图
图 11:异常字符示例。出现回车、数字、标点或混乱符号,通常说明原始数据还没有清理干净。
Excel 中说明原始数据存在字符的截图
图 12:Excel 中定位异常字符的示例。先回到原始表修正,再重新上传分析。
没有需要规范字段的匹配结果截图
图 13:如果匹配结果为空,说明当前标准库没有识别出需要规范的字段。

数据清洗

数据清洗页面需要同时上传原始数据和清洗规则。点击清洗后,先看提示信息,再下载清洗后的数据,并继续转换为宽格式。

清洗规则文件填写示例截图
图 14:原使用说明中的清洗规则填写示例。第 2 列“替换为”填标准名称;留空时通常代表删除该字段。
数据清洗页面上传原始数据和清洗规则的截图
原指南截图:数据清洗页面需要同时上传待清洗数据和清洗规则。点击“清洗数据”后,页面会提示重复字段、剂量异常等问题。
数据清洗页面提示重复中药和剂量问题的截图
原指南截图:橙色提示区会列出重复中药、剂量缺失、剂量小数等问题。先修正这些提示,再进入宽数据转换。
转换后的宽数据页面截图
原指南截图:宽格式数据会自动按字段频数排序,后续属性功效、聚类、关联规则、处方相似度和共现网络都常用这种格式。
清洗规则留空代表删除字段后出现 NA 的截图
原指南截图:清洗规则中“替换为”留空代表删除该字段。清洗页面可能显示 NA,这是用于提醒用户字段已被删除。
宽数据转换后 NA 列位置的截图
原指南截图:转换宽数据后如果出现 NA 列,下载宽数据后删除该列即可;如果 NA 列很靠后,对多数分析影响有限。
  • 如果提示同一行有重复字段,需要回到原始数据或清洗规则中修正。
  • 转换为宽数据前,确认没有空列、重复字段或剂量异常。
  • 宽数据是后续属性功效、聚类、关联规则、处方相似度和共现网络的常用输入。
  • 清洗后的原始格式数据可用于剂量分析和综合分析。

数据分析模块

完成字段匹配、数据清洗和宽数据转换后,就可以进入“数据分析”应用。下面的截图使用平台测试宽数据 内服中药宽数据-测试.xlsx 跑出,包含 297 条处方记录、177 个中药字段,图片不是手绘示意图,而是调用平台同一套分析函数得到的真实输出。

中药属性与功效分析 上传宽数据,查看四气、五味、归经、功效等分布。若内置标准库未覆盖某些药物,需要自行补充属性和功效信息。
聚类分析 基于 Phi 相关系数观察字段之间的相关性。强正相关并位于同一聚类的组合,更适合作为潜在核心组合讨论。
关联规则 先探索支持度和置信度组合,再选定参数做正式分析。结果过多时提高阈值,结果过少时降低阈值。
处方相似度 使用 Jaccard 相似度计算方剂之间的组成接近程度。越接近 1,两个方剂越相似。
共现网络 展示中药之间的共现关系,并可结合功效映射节点颜色。自定义功效时不要把分类拆得过细。
剂量分析 使用带剂量的清洗后数据,观察剂量占比和剂量分布。调整绘图参数后需要重新点击分析。
综合分析 可组合 2 到 4 个维度,例如症状、证型、中药。第 1 列仍然需要是 id。
下载与留痕 每一步关键结果都建议下载保存,包括清洗规则、宽数据、分析表格和图片,便于论文复核。
如果研究主题天然包含某个高频字段,例如“含黄芪方剂”的全部处方都有黄芪,关联规则和聚类分析前可以考虑移除该字段,否则它会主导结果。
本页真实结果数据包

包含宽数据预览、关联规则探索表、正式规则表、Phi 相关矩阵和处方相似度表,可与页面截图互相核对。

下载结果数据

中药属性与功效分析

从“中药属性与功效分析”到“共现网络”,都使用宽格式数据。该模块用于查看四气、五味、归经、一级功效、二级功效等分布。

1
上传宽数据第 1 列为 id,其余列为中药 0/1 字段。系统默认读取 Excel 第 1 个工作簿。
2
补充未收录中药如果“匹配字段”页面仍显示未收录中药,需要自行补足四气、五味、归经、功效信息,否则属性统计会缺项。
3
调节绘图参数点击“属性可视化”或“功效可视化”展开参数。原指南建议属性图可先用字体比例 4.5、宽 8、高 6;功效图可先用 ignore 0.03、字体比例 2.5、宽 10、高 10。
中药属性与功效分析页面参数区截图
原指南截图:上传宽数据后即可分析。自定义追加数据要注意删除空格,并用英文逗号分隔多项属性或功效。
中药属性与功效分析结果表截图
原指南截图:属性和功效结果中可查看频数与加权频数。加权频数会把中药自身出现频次纳入计算,更适合反映总体占比。
功效分类并非绝对统一。若教材、药典和临床应用存在差异,后续共现网络可通过“追加功效”覆盖默认分类,让图更贴合研究解释。

聚类分析

聚类分析用于观察字段之间是否经常一起出现。原使用说明特别强调:平台基于 Phi 相关系数进行聚类与可视化,不再沿用传统层次聚类直接处理 0/1 数据的思路。

1
上传宽数据进入“聚类分析”页,上传第一列为 id、后续列为 0/1 的宽格式 Excel。
2
设置字段数量“提取前 n 个字段”建议先从 30 开始。字段太多会让热图过密,字段太少可能漏掉重要组合。
3
点击 Phi 相关分析先看 Phi 相关矩阵,再切到“Phi 聚类可视化”。需要写论文时,下载表格和图片一起留存。
原使用说明中的 Phi 聚类分析方法说明截图
原指南截图:Phi 相关系数适合 0/1 字段之间的相关性分析。中药、症状、舌脉等二分类字段都可按这个思路理解。
原使用说明中的聚类分析操作页面截图
原指南截图:可以设置提取前 n 个字段、聚类数、字体角度、单格大小、聚类高度等。中文图片建议下载 TIFF。
平台真实输出的 Phi 相关矩阵预览
图 15:Phi 相关矩阵预览。正值表示两个字段倾向于共同出现,负值表示共同出现较少;不要只看单个数值,要结合样本量和临床意义。
平台真实输出的 Phi 聚类热图
图 16:Phi 聚类热图。红色区域代表正相关更强,蓝色区域代表负相关或弱相关;同一聚类分支中的字段可作为候选核心组合继续讨论。
聚类结果不是“自动给核心方”。它更适合帮助研究者发现稳定共现结构,后续仍需结合频数、功效归类、证候/症状背景和专家解释。

关联规则

关联规则用于回答“出现 A 时,是否经常同时出现 B”。原使用说明把它拆成两步:先探索不同支持度、置信度组合下的规则数量,再选择参数进入正式分析。

1
先探索规则上传宽数据后,保留默认支持度和置信度列表,点击“探索规则”。如果所有组合规则数都过多,整体提高支持度或置信度。
2
再分析规则选择一组可解释、数量适中的参数。本页示例使用支持度 0.07、置信度 0.60、最小提升度 1。
3
看四类输出规则探索表用于选参数,规则分布看总体形态,规则矩阵看强规则,规则网络看字段连接关系。
原使用说明中的关联规则探索参数面板截图
原指南截图:支持度组合和置信度组合用英文逗号分隔。示例中 10 个支持度、9 个置信度会形成 90 组参数组合。
原使用说明中的关联规则探索结果表截图
原指南截图:探索结果会返回每组参数对应的规则数、支持度范围、置信度范围和最小提升度。默认参数不一定适合所有数据。
原使用说明中的关联规则探索气泡图截图
原指南截图:探索图通常建议放在论文正文或方法结果中,用来说明支持度、置信度不是凭感觉选择的。
原使用说明中的探索规则表下载结果截图
原指南截图:探索规则表可下载保存。原指南建议一般选择规则数在 200 到 500 左右的参数组合,再进入正式分析。
原使用说明中的分析规则参数面板截图
原指南截图:选定支持度、置信度、最小提升度后,点击“分析规则”。示例参数仅用于演示,不应作为固定标准。
原使用说明中的关联规则分析结果表截图
原指南截图:正式结果表将前项、后项、支持度、置信度、覆盖度、提升度、计数、总项数分开展示,便于筛选二阶、三阶、四阶规则。
平台真实输出的关联规则探索表
图 17:关联规则探索表。支持度越高,要求组合出现次数越多;置信度越高,要求前项推出后项的比例越高。
平台真实输出的关联规则探索可视化
图 18:探索可视化。气泡越大表示该参数组合下规则数越多;教程中建议先选“规则数可读、支持度不太低”的区域。
平台真实输出的关联规则表
图 19:正式关联规则表。前项是条件,后项是结果;提升度大于 1 表示这条规则比随机共同出现更值得关注。
平台真实输出的关联规则分布图
图 20:规则分布图。点越靠右支持度越高,越靠上置信度越高;颜色表示规则数量或强度分布,用来发现参数是否过松。
原使用说明中的关联规则分布图截图
原指南截图:规则分布图使用抖动方式避免点过密,因此图片上的点数不一定等于规则条数;它主要用于看整体分布。
平台真实输出的关联规则矩阵图
图 21:规则矩阵。气泡大小和颜色可映射支持度、置信度或提升度,适合从前 20 条左右规则中挑出可解释组合。
原使用说明中的关联规则矩阵图截图
原指南截图:规则矩阵中的“+3 items”表示前项还有 3 个字段未展示。导出时宽高需要按当前数据反复微调。
平台真实输出的关联规则网络图
图 22:规则网络。节点和连线用于观察高频药物之间的规则关系;网络越复杂,越需要回到规则表筛选核心规则。
关联规则最容易被“全体处方都包含的字段”带偏。若某个字段由研究纳入标准决定,正式分析前建议考虑移除,或在论文方法中说明保留原因。

处方相似度

处方相似度使用 Jaccard 系数比较两个处方的组成接近程度。它适合发现高度相似的方剂、重复或近重复记录,也可以用来寻找处方群。

1
上传宽数据仍然使用第一列为 id、后续列为 0/1 的宽格式数据。
2
设置相似度阈值默认 0.75 适合先筛高相似处方。阈值越高,保留下来的处方对越少,但相似性更强。
3
看表和热图表格用于定位具体处方对;热图用于看整体是否形成相似处方块。交互热图中悬停格子可查看两个 id 和相似度。
原使用说明中的 Jaccard 相似度原理图
原指南截图:Jaccard 相似度关注两个方剂共同字段占总体字段的比例。平台目前适合 1000 到 1500 行以内的数据规模,过大数据建议联系管理员。
原使用说明中的处方相似度结果表截图
原指南截图:id1 和 id2 是两个方剂的编号,Jaccard 为 1 说明两个方剂组成完全一致,越接近 0 表示越不相似。
平台真实输出的处方相似度结果表
图 23:相似度结果表。Jaccard 等于 1 表示两个处方在宽数据字段上完全一致;低于阈值的处方对不会出现在筛选表中。
平台真实输出的处方相似度热图
图 24:处方相似度热图。红色块表示一组处方之间组成更接近;大样本热图重点看聚集块,不需要逐格解释。
原使用说明中的处方相似度三种结果示例图
原指南截图:示例 1 红色块少,常见于相似度低的数据;示例 2 红色块多,更利于提取核心方;示例 3 出现较大红色区块,可结合症状、证候继续解释。
如果热图出现大片完全相同的红色区域,先检查是否存在重复处方、相同来源记录或宽数据转换时的字段合并问题,再决定是否进入统计解释。

共现网络

共现网络用于展示中药之间的共同出现关系。平台会把 degree 值、共现次数和功效分类映射到节点、连线、颜色等视觉元素上。

1
上传宽数据该模块只支持中药之间的共现网络,输入仍是宽格式数据。
2
控制字段和共现次数如果图中节点少于“提取前 n 个字段”,通常是最小共现次数筛掉了一部分字段,可把最小共现次数降到 1 试试。
3
必要时追加功效如果默认功效分类与研究解释不匹配,可上传自定义功效覆盖默认值。一级功效最好控制在 8 到 10 类以内。
原使用说明中的共现网络结果图
原指南截图:节点越大通常代表连接越多,连线越粗代表共现越多。颜色按功效分类映射,功效分类过细会让图难以解释。
原使用说明中的共现网络配色报错截图
原指南截图:如果功效种类过多,可能超过配色上限。此时建议合并功效分类,或上传自定义功效减少类别数。

剂量分析与综合分析

剂量分析和综合分析不使用宽数据,而是使用清洗后的原始格式数据。剂量分析关注中药剂量占比与分布;综合分析用于组合 2 到 4 个维度观察流向关系。

剂量分析格式 第 1 列为 id,每个中药和对应剂量在一个单元格内;没有剂量时不录入“g”,也无需做剂量分析。
剂量值要求 剂量建议使用整数。古代剂量、体积单位、颗粒剂和粉剂需要先由研究者转换或说明口径。
综合分析维度 至少 2 个维度,最多 4 个维度。临床研究常用“症状 → 证型 → 中药”的流向组合。
重新点击分析 剂量分析绘图计算较多,调整参数后需要重新点击分析按钮,图片才会更新。
原使用说明中的含剂量数据格式截图
原指南截图:含剂量数据格式。每个单元格是“中药 + 整数剂量”,没有剂量就不要补 0。
原使用说明中的剂量分析结果图
原指南截图:剂量分析结果。柱子中间显示剂量,柱长代表剂量占比,具体剂量分布可结合下载表格查看。
原使用说明中的综合分析数据格式截图
原指南截图:综合分析每个维度都要求第 1 列为 id。中药维度需要去掉剂量数字,避免把剂量当成字段。

结果解读建议

  • 不是所有数据都能挖掘出理想核心方。专家经验方、临床医案、专利数据、少数民族医药数据的规律强弱可能差异很大。
  • 处方相似度高的红色区块较多,通常说明方剂组成更接近;若同时有症状或证候数据,可以进一步提取对应方剂做临床解释。
  • 关联规则建议先看规则数量分布,再选一组能解释、数量适中的支持度和置信度。
  • 共现网络的功效分类不宜过多。分析 30 个左右字段时,一级功效最好控制在容易解释的数量范围内。
  • 平台结果应服务于研究问题,不能只看图好不好看。参数选择、字段删留和标准化口径都需要在论文方法中说明。

常见问题

为什么清洗后还要再匹配一次?

因为替换规则可能让同一行出现新的重复字段,也可能暴露前一轮没有注意到的异常名称。再次匹配可以减少后续转换失败。

为什么宽数据转换失败?

最常见原因是同一行存在重复元素、空列、异常符号或清洗规则留空导致生成 NA 列。先回到清洗结果检查最后几列和提示信息。

关联规则多少条比较合适?

没有固定答案。实践上可以先让规则数落在便于阅读和解释的范围,再结合研究问题微调支持度和置信度。

引用与方法

平台主要分析由 R 语言和成熟统计可视化程序包实现。写作论文时,建议说明数据清洗口径、字段标准化规则、支持度与置信度选择、聚类参数、相似度指标和网络筛选条件。

  • 关联规则:arules、arulesViz、ggplot2。
  • 聚类与热图:Phi 相关系数、pheatmap 等。
  • 共现网络:ggplot2、ggraph 等。
  • 处方相似度:Jaccard 系数。

推荐引用:Dan W, Guo X, Zhang G, Zhang H, Liu J, Li Q, et al. SinoMedminer: an R package and shiny application for mining and visualizing traditional Chinese medicine herbal formulas. Chin Med. 2025;20:80.