
智能病历的准确率从哪里来?不是更长的提示词,而是针对中医门诊的后训练。这篇手记公开我们的微调链路、评测口径与真实数字。
为什么走微调
通用大模型在中医场景的典型短板:用法用量格式漂移、药名写错字、诊断用语不规范。提示词能缓解一阵,但要稳定,必须把知识「练进」模型。
我们的流水线
- CoT 训练数据生成:用强模型批量构造带推理链的门诊病历样本,人工抽检校准;
- LLaMA-Factory 训练:LoRA 高效微调,公开 MCQ 基准自动判分,防止「练退步」;
- 评测集逐版本跑分:用法/药名/诊断三轴分开统计,拒绝只看总分。
真数(同一评测集)
- 用法格式正确率:0% → 71.4%(提示词工程阶段几乎无效,微调后跳变);
- 药名准确率 88.0%;诊断规范率 62.5%(R89v5 + v4.7.1 定版);
- 对话体录音适配:ASR 微调链 B 组收口后,真实门诊对话语料的转写质量稳定可用于生产。
基座选型:跨底座对比
我们完成了跨底座的中医 LLM 微调对比研究(论文见研究板块):同一数据与训练配置下,不同基座的中医能力差异显著;自研 jinsixian-tcm 系列(7B 端侧审查型 / 14B 知识型 / 72B 旗舰)按「端侧可用 - 知识密度 - 旗舰质量」三档定位,中医综合评测 0.856。
路线:千人千医
终局不是一个大模型,而是每位名医一个模型:医生持续使用沉淀的诊疗数据(三快照:生成/确认/提交),将成为专属模型的后训练燃料——这也是「经验沉淀为数字资产」的技术底座。
Comments