跨底座家族中医大语言模型微调的系统性对比研究:容量阶梯、家族效应与可教性
——同一数据、同一配方下 8 个开源底座(7B–72B)的中文医考专精微调实证
v1.3(2026-07-27,新增 14 语多语言评测 + 新 3 底座安全/错别字补齐) · 伊妹智能门诊 AIMate 研究团队 · 技术报告
📌 一分钟读懂这篇论文(写给所有人)
我们做了什么? 训练中医 AI 就像教学生考医师执照。我们想知道:用哪个“学生”(开源模型)来教效果最好?于是我们拿同一套教材(27 万道中文医学题的训练数据)、同一种教学方法,教了 8 个不同的“学生”——从 7B(约 70 亿参数的小模型)到 72B(约 720 亿参数的大模型),涵盖阿里 Qwen 系、智谱 GLM、Meta Llama 三大家族,然后用同一套 1,612 道没人见过的考试题统一阅卷。
我们发现了什么?
- 模型越大,教完考得越好,而且每一档提升都经得起统计检验——7B 考 36 分,14B 考 71 分,32B 考 76 分,72B 考 85 分(满分 100)。花钱堆算力训大模型,值。
- 新一代的“学生”更聪明——同样 14B 块头,新一代 Qwen3 比上一代多考 2.5 分;而一个“底子几乎为零”(原始只考 4.2 分)的 R1 推理小模型,教完能考 65.7 分,是全场“进步最快的差生”。起点低 ≠ 没前途,关键看可塑性。
- 我们本地训练的 72B 模型,考分打平了能联网查答案的国际一线大模型(85.6 vs 86.8,统计上无差别)——诊所不用联网、患者数据不出门,也能有一线水平的中医 AI。
- 意外收获:安全感和容量有关——小模型审查处方时“看什么都像错的”(好方子也乱报警),到 32B 这个块头突然“开窍”,误报率大幅下降。
一句话:开诊所要用的中医 AI,底座选“新一代 Qwen3 系 + 足够大”,安全审查单独配一个专用小模型。
👉 没时间读全文,看到这里就够了。想看证据和方法,请继续——每一节末尾都有「通俗解读」,文末附「术语表」。
摘要
针对「基层诊所本地可部署的中医专精大模型」这一目标,我们在完全相同的训练数据(270,208 条)与完全相同的微调配方下,系统训练了横跨 Qwen(R1-Distill/Qwen2.5/Qwen3 三系)、GLM-4、Llama 三大家族、多个代际、7B–72B 容量谱的 8 个开源底座(7 个完成全量训练与评测,1 个中止),回答三个问题:(1)容量扩展是否带来稳定收益?(2)更换模型家族/代际是否有额外增益?(3)与前沿联网模型相比,本地开源专精模型处于什么位置?
主要发现:①容量阶梯单调有效——R1-Distill-Qwen 系 7B→14B→32B→72B,中医 MCQ 准确率 36.0%→71.0%→76.3%→85.3%,通用医学 43.7%→73.7%→83.8%→90.3%,7 个模型各自的 base→tuned 提升均为配对 McNemar 显著(p≈0)。②家族/代际有独立增益——同为 14B,Qwen3 原生底座双轴全胜 R1-Distill-Qwen-14B(中医 73.5% vs 71.0%,通用 80.0% vs 73.7%);DeepSeek-R1-0528-Qwen3-8B 展现全表最强「可教性」(base 仅 4.2%,微调后 65.7%,Δ+61.5pp)。③本地 72B 打平联网前沿——纯本地、不联网的 Qwen2.5-72B 微调模型与联网前沿 v4-pro 在 n=811/801 大 held-out 上统计持平(中医 85.6% vs 86.8%,p=0.47;通用 89.8% vs 87.6%,p=0.18)。安全评测另发现容量跃变现象:32B 起安全审查特异度从 ~0.03 跃升至 0.73,幻觉率下降 9 倍。全部原始评测数据、显著性统计与训练 provenance 随本文公开。
关键词:中医大语言模型;参数高效微调(QLoRA);模型容量;跨家族对比;去污染评测;McNemar 检验
1. 引言
基层中医诊所的智能化辅助(语音转写、病历生成、处方安全审查)对语言模型提出三个硬约束:专精(中医辨证论治知识与医考级答题能力)、本地(患者数据不出诊所,模型须可在消费级 GPU 上量化运行)、可信(安全审查不滥报不漏报)。这决定了我们的技术路线:以开源底座 + 领域数据微调获得专精能力,而非依赖云端通用 API。
在此路线下,一个关键的工程与科学问题是:底座怎么选? 容量(7B/14B/32B/72B)、家族(Qwen/GLM/Llama)、代际(Qwen2.5/Qwen3)、推理血统(R1 蒸馏/原生)四个维度交织,社区经验结论多来自通用英语基准,对中文医学专精场景未必成立。传闻式结论(“越大越好”或“小模型够用”)都不可靠——唯有控制变量:同数据、同配方、同评测,逐一替换底座,才能得到可决策的证据。
本研究即这一控制变量实验的完整记录。我们的贡献:
- 一张可复现的跨底座对比表:8 个底座(7 完成 + 1 中止)× 同一 270,208 条训练集 × 同一 QLoRA 配方 × 同一 n=1,612 大 held-out,全部配对统计显著性检验;
- 三个实证结论:容量阶梯单调、家族/代际有独立增益、「可教性」(teachability)与 base 分数负相关;
- 一个安全容量跃变发现:安全审查特异度在 32B 档发生阶跃(0.03→0.73),对临床部署的审查链路设计有直接指导意义;
- 完整的数据治理与诚实边界:held-out 与训练集零重叠经多轮独立核验,所有不可比因素(库兼容折扣、收敛提前停止)如实标注。
2. 数据
2.1 训练集
全部 run 使用同一 v3 训练集,270,208 条,8 个来源(各文件 SHA-256 前缀逐 run 经 run_manifest.json 核验一致):
| 文件 | 内容 | SHA-256 前缀 |
|---|---|---|
| cmb_train_sft_full_v2 | CMB(中文医疗基准,arXiv:2308.08833)train 转 SFT,已剔除 held-out | e8a64bee |
| cmexam_train_sft | CMExam 真题训练集(已去除与 held-out/CMB 重叠,净增 43,695) | f3b57980 |
| r1_tcm_cot | R1 蒸馏中医辨证论治推理链 | 7cbe3ef3 |
| knowledge_kb | 中医知识库问答 | f19855c9 |
| tcm_formula_kb | 方剂知识库 | 5b74f8f8 |
| typo_correction | 药名错别字纠正 | ee387938 |
| clinical_review_synthetic | 合成处方审查案例 | c3538856 |
| tcm_mcq_train | 中医 MCQ 训练题 | 114e76b6 |
2.2 评测集(held-out)与去污染
主评测为 CMB 大 held-out:从 CMB-train 分层切出,近重复去污(丢弃 384 道改写重题)后从训练集中删除该批题目(→ cmb_full_v2),最终 cmb_tcm(中医)n=811、cmb_medical(通用医学)n=801。外部基准 CMExam 因与 CMB-train 存在 19.2% 逐字重叠(非独立)被弃用为评测集,仅作训练补充。
去污染经三轮独立核验:(1)切分时近重去污门(0/1,609 通过);(2)对全部 8 个训练文件做 char-8gram containment + 精确子串核验,0 泄漏;(3)2026-07-14 可信度复审以跨全源精确匹配复查,残留污染影响 ≤0.12pp,可忽略。安全评测集扩至 n=195(30 个 clean 标准方 + 165 个错例,全部经 check_prescription_safety 自检且与训练评审池不相交)。错别字评测 n=90。
2.3 数据合规
训练数据全部来自公开学术基准与自建知识库,不含任何真实患者数据(PII-free)。残留风险为上游考题版权未逐题清权(行业通用灰区),本文如实披露。
3. 方法
3.1 微调配方
本地与 32B 云训统一使用自研 train_lora.py:QLoRA 4-bit + packing,epochs=1,LoRA rank=16(alpha=32),lr=1e-4,cutoff 1024(32B 云训 2048)。选用自研栈而非 LLaMA-Factory 的关键原因是健康门:训练后对推理模型做退化检测(空 <think>、重复崩溃),exit 3 拦截坏模型——曾因 LLaMA-Factory deepseekr1 模板在 no-think 数据上令推理模型崩溃且无任何门拦,得出一版完全错误的“32B≈14B”结论(已作废,详见 §6.4)。72B 因单机不可行,采用 AWS 4×g6e.2xlarge 多机 DDP(LLaMA-Factory + Liger + paged_adamw_8bit,template=qwen,非推理底座无此崩溃风险)。
3.2 评测协议
全部模型同 harness:base 4-bit + LoRA adapter,batch 8,max_new_tokens=512(GLM-4 例外,见 §7)。每模型先评 base 再评 tuned,同题配对。判分为精确集合相等(多选须一字不差,防止乱答刷分)。空答率全程为 0,排除“格式学不会”干扰——base→tuned 增益为知识增益而非格式增益。
3.3 统计
base→tuned 及跨模型配对比较用 McNemar 检验(同题配对,报告胜/负题数与 p 值);与前沿模型(独立样本)比较用两独立比例 z 检验;准确率报告 Wilson 95% CI。
4. 实验设置:训练全景
| 模型 | 家族/代际 | 训练位置·硬件 | 配方 | steps | 训练时长 | 产物 |
|---|---|---|---|---|---|---|
| DeepSeek-R1-Distill-Qwen-7B | R1-Distill | 本地 RTX 5090 | train_lora | 2190 | ~5.1h | jinsixian-tcm-7b-v3pack |
| DeepSeek-R1-Distill-Qwen-14B | R1-Distill | 本地 RTX 5090 | train_lora | 2190 | ~8.6h | jinsixian-tcm-14b-v3pack |
| DeepSeek-R1-Distill-Qwen-32B | R1-Distill | AWS spot/on-demand 断续 resume | train_lora(云上,cutoff 2048) | 2190 | 07-04→14 断续 | jinsixian-tcm-32b-v3pack |
| Qwen2.5-72B-Instruct | Qwen2.5 | AWS 4×g6e 多机 DDP | LLaMA-Factory | 5266(收敛于 ckpt-2400) | ~12h 级 | 72b-mn-v2(S3) |
| DeepSeek-R1-0528-Qwen3-8B | Qwen3+R1-0528 | 本地 RTX 5090 | train_lora | 2190 | ~5.9h | jinsixian-tcm-r1qwen3-8b-v3 |
| Qwen3-14B | Qwen3 原生 | 本地 RTX 5090 | train_lora | 2283 | ~18.9h | jinsixian-tcm-qwen3-14b-v3 |
| THUDM/glm-4-9b | GLM-4(智谱) | 本地 RTX 5090 | train_lora | 2108 | ~5.2h | jinsixian-tcm-glm4-9b-v3 |
| DeepSeek-R1-Distill-Llama-70B | Llama | AWS g7e.4xlarge | — | 150/755 中止 | ~3.8h | ckpt-150 留 S3 |
注:72B 的 max_steps=5,266 但 loss 自 step~130 起进入死平带(均值 0.084/标准差 0.036,无下降趋势),于 checkpoint-2400(46%)判定收敛停止,节省约 $25 且 provably 零增益;Llama-70B 训 3h40m 仅 150/755 步(0.06 epoch),续训需约 $45,边际信息价值不足,中止,checkpoint 保留可 resume。
5. 结果
5.1 主结果:MCQ 大 held-out(cmb_tcm n=811 / cmb_medical n=801)
| 模型 | base 中医 | tuned 中医 | Δ | base 通用 | tuned 通用 | Δ |
|---|---|---|---|---|---|---|
| R1-Distill-Qwen-7B | 13.7% | 36.0% | +22.3pp | 19.9% | 43.7% | +23.8pp |
| R1-Distill-Qwen-14B | 38.2% | 71.0% | +32.8pp | 41.8% | 73.7% | +31.8pp |
| R1-Distill-Qwen-32B | 41.3% | 76.3% | +35.0pp | 48.3% | 83.8% | +35.5pp |
| Qwen2.5-72B-Instruct | 61.8% | 85.3% | +23.5pp | 72.0% | 90.3% | +18.2pp |
| R1-0528-Qwen3-8B | 4.2% | 65.7% | +61.5pp | 6.4% | 72.8% | +66.4pp |
| Qwen3-14B | 32.1% | 73.5% | +41.4pp | 31.2% | 80.0% | +48.8pp |
| GLM-4-9B ⚠️ | 39.8% | 68.1% | +28.2pp | 37.5% | 70.5% | +33.1pp |
| 参考:v4-pro(联网前沿) | — | 86.8% | — | — | 87.6% | — |
全部 7 个模型 base→tuned 提升均 McNemar p≈0(显著提升)。⚠️ GLM-4 因 remote code 与 transformers 4.57 三处不兼容、强制 use_cache=False 导致只能以 max_new=128 跑评(其他模型 512),分数含库兼容折扣(估计被低估 2–5pp),与其他行不严格可比。
5.2 与联网前沿对比
v4-pro(联网,可检索答案)在同 held-out、同 prompt、同判分下:中医 86.8%、通用 87.6%。两独立比例 z 检验:中医 72B 85.6% vs 86.8%,z=−0.72,p=0.47(持平);通用 72B 89.8% vs 87.6%,z=+1.34,p=0.18(持平)。即纯本地、不联网的开源 72B 专精模型与联网前沿同档。此前 n=55 小样本曾出现“超前沿”假象,大样本(n 大 15 倍)纠正为持平——准确表述为「同档,随题集分布小幅上下」。
5.3 安全评测(处方审查,灵敏度/特异度)
| 模型 | n=66 灵敏/特异 | n=195 灵敏/特异 | 幻觉率(n=195) | 危险建议率 |
|---|---|---|---|---|
| 7B | 0.446/0.20 | 0.539/0.10 | 0.482 | 0.041 |
| 14B | 0.786/0.00 | 0.697/0.03 | 0.374 | 0.015 |
| 32B | 0.625/0.90 | 0.746/0.73 | 0.041 | 0.021 |
| 72B(知识模型) | 1.00/0.00 | 未复评 | 未复评 | 未复评 |
| R1-0528-Qwen3-8B | — | 0.539/0.43 | 0.313 | 0.021 |
| Qwen3-14B | — | 0.824/0.17 | 0.195 | 0.000 |
| GLM-4-9B ⚠️ | — | 0.0/1.0(无效值,输出退化所致) | 0.0 | 0.169 |
容量跃变:14B→32B 特异度 0.03→0.73——7B/14B/72B 均患“逢方乱报”病(特异度≈0,clean 方也报有问题),32B 档首次治愈;幻觉率 0.374→0.041(9× 下降)。生产审查链路仍使用专用平衡版 7b-safe(0.48/0.90,rebalance 配比训练,特异度优于前沿 API 的 0.10)。
5.4 错别字纠正(n=90)
| 模型 | 纠正准确率 |
|---|---|
| 7B | 0.300 |
| 14B | 0.689 |
| Qwen3-14B | 0.778 |
| R1-0528-Qwen3-8B | 0.722 |
| 32B | 0.711 |
| GLM-4-9B | 0.556 |
| 72B | 0.844 |
5.5 多语言评测(14 语,v1.3 新增)
方法:同卷不同语——同一份 clean held-out(797/787)经术语锚点约束的机器翻译(105 条术语表,答案字母不变、判分零改动)译成 13 种语言,同 harness 逐语言评测;zh 用 clean 原集同卷锚定,Δ 为与各语言对 zh clean 基准的差值。
主矩阵(tuned 准确率%,括号内 = Δ vs zh):
| 语言 | qwen3-14b 中医 | qwen3-14b 通用 | 14b-v3 中医 | 14b-v3 通用 |
|---|---|---|---|---|
| zh(基准) | 73.3(—) | 79.5(—) | 70.8(—) | 73.4(—) |
| en | 63.2(−10.0) | 78.1(−1.4) | 57.1(−13.7) | 73.8(+0.4) |
| es | 56.6(−16.7) | 70.8(−8.8) | 47.8(−23.0) | 63.1(−10.3) |
| pt-BR | 55.3(−17.9) | 73.2(−6.3) | 49.1(−21.7) | 61.0(−12.4) |
| vi | 48.9(−24.3) | 66.1(−13.5) | 42.4(−28.4) | 58.5(−15.0) |
| th | 56.5(−16.8) | 71.8(−7.8) | 49.7(−21.1) | 60.2(−13.2) |
| id | 53.4(−19.8) | 70.8(−8.8) | 42.9(−27.9) | 58.5(−15.0) |
| ms | 51.1(−22.2) | 65.2(−14.4) | 41.9(−28.9) | 55.6(−17.8) |
| ar | 49.3(−24.0) | 63.5(−16.0) | 41.0(−29.7) | 53.1(−20.3) |
| tr | 48.7(−24.6) | 68.0(−11.6) | 38.5(−32.2) | 53.1(−20.3) |
| fa | 49.4(−23.8) | 64.9(−14.6) | 37.4(−33.4) | 45.5(−28.0) |
| ru | 52.2(−21.1) | 74.2(−5.3) | 46.3(−24.5) | 63.4(−10.0) |
| kk | 41.0(−32.2) | 52.9(−26.7) | 25.6(−45.2) | 31.9(−41.5) |
| uz | 39.5(−33.8) | 55.6(−23.9) | 28.2(−42.5) | 37.2(−36.2) |
五条结论:
- 中医知识强中文绑定——两型号中医轴全语言衰减(−10~−45pp)且远大于通用轴,多语言中医服务需补多语言训练数据;
- 通用医学韧性强——en 几乎不掉(14b-v3 反 +0.4pp,噪声内持平);
- qwen3-14b 全语言压制 14b-v3(14/14 双轴全胜)——主推选型在多语言维度同样成立;
- 低资源语言(kk/uz)塌方(14b-v3 kk 中医仅 25.6%)——现阶段这些区域只能回退英语服务;
- RTL(ar/fa)无额外折扣。
6. 讨论
6.1 容量阶梯单调有效
R1-Distill 系 7B→14B→32B→72B,tuned 中医 36.0→71.0→76.3→85.3,通用 43.7→73.7→83.8→90.3,无平台期、无倒挂。且 14B 档“扩数据”已无效(30K→225K 无显著提升,容量被 30K 喂饱)——要更进,靠容量不靠数据。这对部署的直接含义:能力是“压”出来的(蒸馏 72B→14B/7B),而非小模型直接训出来的。
6.2 家族/代际的独立增益
同容量 14B,Qwen3 原生(73.5/80.0)双胜 R1-Distill-Qwen-14B(71.0/73.7)——新代际底座在相同数据配方下多 2–6pp。家族更换(GLM-4-9B 68.1%)达到 9B 档合格线,但不敌同档 Qwen3 系。选型建议随之更新:14B 生产线应以 Qwen3 系底座重训。
6.3 可教性(teachability)与 base 分数负相关
R1-0528-Qwen3-8B base 中医仅 4.2%(几乎不会答),微调后 65.7%,Δ+61.5pp 全表第一;而 base 最高的 72B(61.8%)Δ 最小(+23.5pp)。base 分低不等于底座差——R1 蒸馏底座的推理骨架为领域知识注入提供了极佳的可塑空间,7B 级即可训至 65%+ 中医准确率(达 R1-Distill-14B 的 92%)。这对边缘部署是好消息:小模型“考得差”是可教的,训后可用。
6.4 一次反面教训:配方与门控比模型更重要
首版 32B 使用 LLaMA-Factory deepseekr1 模板在 no-think 数据上训练,推理模型学会输出空 <think></think> 并部分退化(###**** 垃圾),MCQ 被低估 0.09–0.13、错别字从 0.822 塌至 0.289(注:此为彼时 30K 时代评测集的数字,与 §5.4 的 v3 n=90 集不同尺子)——险些得出“容量无用”的错误结论。推理模型训 no-think 数据,必须用保留推理的配方 + 训练后健康门双保险;这也是我们坚持自研 train_lora.py 的原因。
6.5 部署路线
- 知识/生成主力:蒸馏 72B→14B/7B(把 CMB 专精压进诊所可本地量化的小模型);
- 需辨证论治 CoT:32B-full-lora(保推理链);
- 安全审查:专用平衡版 7b-safe(非知识模型——知识模型安全轴“逢方乱报”,特异度 0.10,不可用于审查)。
7. 局限性
- GLM-4 评测折扣:库兼容问题强制 use_cache=False(O(n²) 生成),评测以 max_new=128 完成,分数或被低估 2–5pp;且其 base 空答率 ~6%(按答错计入,Δ 上限影响 ~6pp)与库折扣叠加——与其他行不严格可比;严格重评应换官方 glm-4-9b-chat-hf(transformers 原生支持)重训。
- base 空答非零:tuned 空答 7/7 全为 0/0,但 base 空答 0.1%–6.3%(多为格式未跟随)按答错计入——base 分数含格式失败成分,非纯知识水平;对 Δ 上限影响 ≤6.3pp,不改变任何显著性结论(逐模型量化见 analysis_reports/eval_coverage_audit_2026-07-22.md)。
- 72B 为收敛检查点(epoch 0.46,loss 死平带内),非满跑;与同系列满跑分数在噪声内一致,但严格来说不是“完整 1 epoch”。
- GLM-4 安全评测为无效值(灵敏 0/特异 1.0 是输出退化所致,非真实能力);根治需换官方 chat-hf 重训重评。
- Llama 家族缺失:70B run 中止,家族对比少一角。
- 分布特异性:所有结论限于 CMB 中文医考分布的专精微调场景;“打平前沿”指该分布,不等于整体医学能力超越。
- 量化影响:评测全程 4-bit,只会拖低不会抬高,绝对分数为保守下界。
- 多语言结论的边界:13 语考题为术语约束的机器翻译版(Δ 含翻译折扣),结论限「该翻译版试题上的表现」;kk/uz 等低资源语言的低分同时含模型多语能力与翻译质量两个因素。
8. 结论
在同一数据、同一配方的严格控制下,中医专精微调的底座选择有清晰的可操作结论:容量单调有效;新代际底座(Qwen3 系)在同容量下额外 +2–6pp;R1 蒸馏底座“可教性”最强;纯本地 72B 可与联网前沿打平;安全审查存在 32B 容量跃变。 对基层诊所部署,推荐“72B 蒸馏→Qwen3 系 14B 生产 + 7b-safe 审查”的组合路线。
附录 A:复现
# 单个新底座(本地 RTX 5090)/ A single new base (local RTX 5090) bash finetune/scripts/train_new_base_local.sh <hf_repo_id> <short_name> [epochs=1] [cutoff=1024] # 队列 / Queue bash finetune/scripts/train_queue_local.sh # 汇总出表 / Summary table python3 finetune/eval/summarize_v3full.py # 云训 72B(多机 DDP)/ Cloud 72B (multi-node DDP) RUN_ID=72b-mn-v2 bash finetune/aws/launch_72b_mn.sh 4
原始评测数据:finetune/eval/results/(validation_*_v3full.json 含逐题结果与 McNemar 统计、safety_*.json、typo_*.json、v3full_summary.json);训练 provenance:finetune/eval/results/manifests/(各 run 的 run_manifest.json,含 base 路径、8 数据文件 SHA-256、配方、git commit)。
附录 B:伦理与数据合规声明
本研究训练数据全部为公开学术基准与自建知识库,不含真实患者数据;held-out 与训练集零重叠经三轮独立核验;所有不可比因素与负面结果(含一版作废结论)均如实披露。上游考题的版权灰区已在 §2.3 披露,模型权重按各底座许可证使用(随模型附带《AIMate-TCM 模型社区许可 v1.0》:学习研究免费、商业须授权、全球南方与“一带一路”优惠)。
附录 C:术语表(写给非专业读者)
| 模型 / 底座(base) | 未经我们培训的原始开源大模型,如 Qwen3-14B。参数量单位 B=十亿,7B≈70 亿参数 |
| 微调(fine-tune)/ tuned | 用领域数据对底座做再培训;tuned=培训后的模型 |
| QLoRA | 一种省显存的微调技术:冻结模型本体,只训练一小块“外挂”参数,消费级显卡可用 |
| 4-bit 量化 | 把模型数值精度压缩到 4 比特以省显存/提速,代价是轻微掉分 |
| MCQ | 选择题(Multiple Choice Questions),本文的主考试科目 |
| held-out(留出集) | 训练时绝不给模型看的考题,用来公平打分 |
| 去污染 | 确认考题没有泄漏进训练数据(防止“背题考高分”) |
| base→tuned 提升(Δ) | 同一模型培训前后的分数差,单位 pp=百分点 |
| McNemar 检验 / p 值 | 判断“进步是否真而非运气”的统计方法;p≈0 表示几乎不可能是巧合,p=0.47 表示差异不显著(打平) |
| 95% CI(置信区间) | 分数的误差范围,如 CI±2.4% 表示真实分数大概率在 ±2.4 个百分点内 |
| 灵敏度 / 特异度 | 安检术语:灵敏度=坏人被拦住的比例(防漏),特异度=好人被放行的比例(防冤) |
| 幻觉(hallucination) | 模型“一本正经地瞎编”的比例 |
| 蒸馏(distill) | 把大模型学到的知识“教给”小模型,让小模型便宜地拥有大模型能力 |
| CoT(思维链) | 模型回答前先“写推理过程”再下结论的能力,中医辨证论治尤其需要 |
| v4-pro | 某国际一线商业大模型(可联网),本文用作“前沿参考线” |
| epoch / step | 训练进度单位:step=一次参数更新,epoch=把全部教材完整学一遍 |
本研究涉及的模型为临床决策辅助工具,不替代医生诊疗决策;非医疗器械(未经 NMPA/FDA/EMA 审批)。