返回研究列表
论文2026-07-27

跨底座家族中医大语言模型微调的系统性对比研究:容量阶梯、家族效应与可教性

——同一数据、同一配方下 8 个开源底座(7B–72B)的中文医考专精微调实证

v1.3(2026-07-27,新增 14 语多语言评测 + 新 3 底座安全/错别字补齐) · 伊妹智能门诊 AIMate 研究团队 · 技术报告

📌 一分钟读懂这篇论文(写给所有人)

我们做了什么? 训练中医 AI 就像教学生考医师执照。我们想知道:用哪个“学生”(开源模型)来教效果最好?于是我们拿同一套教材(27 万道中文医学题的训练数据)、同一种教学方法,教了 8 个不同的“学生”——从 7B(约 70 亿参数的小模型)到 72B(约 720 亿参数的大模型),涵盖阿里 Qwen 系、智谱 GLM、Meta Llama 三大家族,然后用同一套 1,612 道没人见过的考试题统一阅卷。

我们发现了什么?

  1. 模型越大,教完考得越好,而且每一档提升都经得起统计检验——7B 考 36 分,14B 考 71 分,32B 考 76 分,72B 考 85 分(满分 100)。花钱堆算力训大模型,值。
  2. 新一代的“学生”更聪明——同样 14B 块头,新一代 Qwen3 比上一代多考 2.5 分;而一个“底子几乎为零”(原始只考 4.2 分)的 R1 推理小模型,教完能考 65.7 分,是全场“进步最快的差生”。起点低 ≠ 没前途,关键看可塑性。
  3. 我们本地训练的 72B 模型,考分打平了能联网查答案的国际一线大模型(85.6 vs 86.8,统计上无差别)——诊所不用联网、患者数据不出门,也能有一线水平的中医 AI。
  4. 意外收获:安全感和容量有关——小模型审查处方时“看什么都像错的”(好方子也乱报警),到 32B 这个块头突然“开窍”,误报率大幅下降。

一句话:开诊所要用的中医 AI,底座选“新一代 Qwen3 系 + 足够大”,安全审查单独配一个专用小模型。

👉 没时间读全文,看到这里就够了。想看证据和方法,请继续——每一节末尾都有「通俗解读」,文末附「术语表」。

摘要

针对「基层诊所本地可部署的中医专精大模型」这一目标,我们在完全相同的训练数据(270,208 条)与完全相同的微调配方下,系统训练了横跨 Qwen(R1-Distill/Qwen2.5/Qwen3 三系)、GLM-4、Llama 三大家族、多个代际、7B–72B 容量谱的 8 个开源底座(7 个完成全量训练与评测,1 个中止),回答三个问题:(1)容量扩展是否带来稳定收益?(2)更换模型家族/代际是否有额外增益?(3)与前沿联网模型相比,本地开源专精模型处于什么位置?

主要发现:①容量阶梯单调有效——R1-Distill-Qwen 系 7B→14B→32B→72B,中医 MCQ 准确率 36.0%→71.0%→76.3%→85.3%,通用医学 43.7%→73.7%→83.8%→90.3%,7 个模型各自的 base→tuned 提升均为配对 McNemar 显著(p≈0)。②家族/代际有独立增益——同为 14B,Qwen3 原生底座双轴全胜 R1-Distill-Qwen-14B(中医 73.5% vs 71.0%,通用 80.0% vs 73.7%);DeepSeek-R1-0528-Qwen3-8B 展现全表最强「可教性」(base 仅 4.2%,微调后 65.7%,Δ+61.5pp)。③本地 72B 打平联网前沿——纯本地、不联网的 Qwen2.5-72B 微调模型与联网前沿 v4-pro 在 n=811/801 大 held-out 上统计持平(中医 85.6% vs 86.8%,p=0.47;通用 89.8% vs 87.6%,p=0.18)。安全评测另发现容量跃变现象:32B 起安全审查特异度从 ~0.03 跃升至 0.73,幻觉率下降 9 倍。全部原始评测数据、显著性统计与训练 provenance 随本文公开。

关键词:中医大语言模型;参数高效微调(QLoRA);模型容量;跨家族对比;去污染评测;McNemar 检验

1. 引言

基层中医诊所的智能化辅助(语音转写、病历生成、处方安全审查)对语言模型提出三个硬约束:专精(中医辨证论治知识与医考级答题能力)、本地(患者数据不出诊所,模型须可在消费级 GPU 上量化运行)、可信(安全审查不滥报不漏报)。这决定了我们的技术路线:以开源底座 + 领域数据微调获得专精能力,而非依赖云端通用 API。

在此路线下,一个关键的工程与科学问题是:底座怎么选? 容量(7B/14B/32B/72B)、家族(Qwen/GLM/Llama)、代际(Qwen2.5/Qwen3)、推理血统(R1 蒸馏/原生)四个维度交织,社区经验结论多来自通用英语基准,对中文医学专精场景未必成立。传闻式结论(“越大越好”或“小模型够用”)都不可靠——唯有控制变量:同数据、同配方、同评测,逐一替换底座,才能得到可决策的证据。

本研究即这一控制变量实验的完整记录。我们的贡献:

  1. 一张可复现的跨底座对比表:8 个底座(7 完成 + 1 中止)× 同一 270,208 条训练集 × 同一 QLoRA 配方 × 同一 n=1,612 大 held-out,全部配对统计显著性检验;
  2. 三个实证结论:容量阶梯单调、家族/代际有独立增益、「可教性」(teachability)与 base 分数负相关;
  3. 一个安全容量跃变发现:安全审查特异度在 32B 档发生阶跃(0.03→0.73),对临床部署的审查链路设计有直接指导意义;
  4. 完整的数据治理与诚实边界:held-out 与训练集零重叠经多轮独立核验,所有不可比因素(库兼容折扣、收敛提前停止)如实标注。
💡 通俗解读市面上开源模型几十上百个,“哪个适合改造成的中医 AI”全靠猜。我们把猜测变成实验——除了“用哪个模型”这一个变量,其他全部保持一致。这样得出的差距,才能归因于模型本身。

2. 数据

2.1 训练集

全部 run 使用同一 v3 训练集,270,208 条,8 个来源(各文件 SHA-256 前缀逐 run 经 run_manifest.json 核验一致):

文件内容SHA-256 前缀
cmb_train_sft_full_v2CMB(中文医疗基准,arXiv:2308.08833)train 转 SFT,已剔除 held-oute8a64bee
cmexam_train_sftCMExam 真题训练集(已去除与 held-out/CMB 重叠,净增 43,695)f3b57980
r1_tcm_cotR1 蒸馏中医辨证论治推理链7cbe3ef3
knowledge_kb中医知识库问答f19855c9
tcm_formula_kb方剂知识库5b74f8f8
typo_correction药名错别字纠正ee387938
clinical_review_synthetic合成处方审查案例c3538856
tcm_mcq_train中医 MCQ 训练题114e76b6

2.2 评测集(held-out)与去污染

主评测为 CMB 大 held-out:从 CMB-train 分层切出,近重复去污(丢弃 384 道改写重题)后从训练集中删除该批题目(→ cmb_full_v2),最终 cmb_tcm(中医)n=811、cmb_medical(通用医学)n=801。外部基准 CMExam 因与 CMB-train 存在 19.2% 逐字重叠(非独立)被弃用为评测集,仅作训练补充。

去污染经三轮独立核验:(1)切分时近重去污门(0/1,609 通过);(2)对全部 8 个训练文件做 char-8gram containment + 精确子串核验,0 泄漏;(3)2026-07-14 可信度复审以跨全源精确匹配复查,残留污染影响 ≤0.12pp,可忽略。安全评测集扩至 n=195(30 个 clean 标准方 + 165 个错例,全部经 check_prescription_safety 自检且与训练评审池不相交)。错别字评测 n=90。

2.3 数据合规

训练数据全部来自公开学术基准与自建知识库,不含任何真实患者数据(PII-free)。残留风险为上游考题版权未逐题清权(行业通用灰区),本文如实披露。

💡 通俗解读考试公平的前提是“学生没背过考题”。我们的考题(1,612 道)不仅在出题时就从教材里删掉了,还做了三轮“查重”,确认没有一道题泄漏进教材——分数是真才实学,不是背题。另外,训练材料全部来自公开考题和医学知识库,没有用过任何一个真实患者的数据。

3. 方法

3.1 微调配方

本地与 32B 云训统一使用自研 train_lora.py:QLoRA 4-bit + packing,epochs=1,LoRA rank=16(alpha=32),lr=1e-4,cutoff 1024(32B 云训 2048)。选用自研栈而非 LLaMA-Factory 的关键原因是健康门:训练后对推理模型做退化检测(空 <think>、重复崩溃),exit 3 拦截坏模型——曾因 LLaMA-Factory deepseekr1 模板在 no-think 数据上令推理模型崩溃且无任何门拦,得出一版完全错误的“32B≈14B”结论(已作废,详见 §6.4)。72B 因单机不可行,采用 AWS 4×g6e.2xlarge 多机 DDP(LLaMA-Factory + Liger + paged_adamw_8bit,template=qwen,非推理底座无此崩溃风险)。

3.2 评测协议

全部模型同 harness:base 4-bit + LoRA adapter,batch 8,max_new_tokens=512(GLM-4 例外,见 §7)。每模型先评 base 再评 tuned,同题配对。判分为精确集合相等(多选须一字不差,防止乱答刷分)。空答率全程为 0,排除“格式学不会”干扰——base→tuned 增益为知识增益而非格式增益。

3.3 统计

base→tuned 及跨模型配对比较用 McNemar 检验(同题配对,报告胜/负题数与 p 值);与前沿模型(独立样本)比较用两独立比例 z 检验;准确率报告 Wilson 95% CI。

💡 通俗解读“教学方法”是一种叫 QLoRA 的轻量微调技术——不动模型本体,只训练一小块“外挂”参数,消费级显卡(RTX 5090)就带得动。阅卷时多选题必须字母一字不差才算对,没法靠蒙。每个模型都考两遍:培训前(base)一遍、培训后(tuned)一遍,同一批题逐题对比,用统计方法(McNemar 检验)确认“进步”不是运气。

4. 实验设置:训练全景

模型家族/代际训练位置·硬件配方steps训练时长产物
DeepSeek-R1-Distill-Qwen-7BR1-Distill本地 RTX 5090train_lora2190~5.1hjinsixian-tcm-7b-v3pack
DeepSeek-R1-Distill-Qwen-14BR1-Distill本地 RTX 5090train_lora2190~8.6hjinsixian-tcm-14b-v3pack
DeepSeek-R1-Distill-Qwen-32BR1-DistillAWS spot/on-demand 断续 resumetrain_lora(云上,cutoff 2048)219007-04→14 断续jinsixian-tcm-32b-v3pack
Qwen2.5-72B-InstructQwen2.5AWS 4×g6e 多机 DDPLLaMA-Factory5266(收敛于 ckpt-2400)~12h 级72b-mn-v2(S3)
DeepSeek-R1-0528-Qwen3-8BQwen3+R1-0528本地 RTX 5090train_lora2190~5.9hjinsixian-tcm-r1qwen3-8b-v3
Qwen3-14BQwen3 原生本地 RTX 5090train_lora2283~18.9hjinsixian-tcm-qwen3-14b-v3
THUDM/glm-4-9bGLM-4(智谱)本地 RTX 5090train_lora2108~5.2hjinsixian-tcm-glm4-9b-v3
DeepSeek-R1-Distill-Llama-70BLlamaAWS g7e.4xlarge150/755 中止~3.8hckpt-150 留 S3

注:72B 的 max_steps=5,266 但 loss 自 step~130 起进入死平带(均值 0.084/标准差 0.036,无下降趋势),于 checkpoint-2400(46%)判定收敛停止,节省约 $25 且 provably 零增益;Llama-70B 训 3h40m 仅 150/755 步(0.06 epoch),续训需约 $45,边际信息价值不足,中止,checkpoint 保留可 resume。

💡 通俗解读8 次训练的“账本”全在这里——在哪台机器上训的、训了多久、花了多少。7 次跑完,1 次(Llama-70B)算了一笔账发现不值(再花 45 美元才能训完,但对结论帮助不大),及时止损。72B 大模型学到一半发现“成绩不再涨了”(loss 曲线走平),也提前停止省钱——这两个决定都如实写在这里。

5. 结果

5.1 主结果:MCQ 大 held-out(cmb_tcm n=811 / cmb_medical n=801)

模型base 中医tuned 中医Δbase 通用tuned 通用Δ
R1-Distill-Qwen-7B13.7%36.0%+22.3pp19.9%43.7%+23.8pp
R1-Distill-Qwen-14B38.2%71.0%+32.8pp41.8%73.7%+31.8pp
R1-Distill-Qwen-32B41.3%76.3%+35.0pp48.3%83.8%+35.5pp
Qwen2.5-72B-Instruct61.8%85.3%+23.5pp72.0%90.3%+18.2pp
R1-0528-Qwen3-8B4.2%65.7%+61.5pp6.4%72.8%+66.4pp
Qwen3-14B32.1%73.5%+41.4pp31.2%80.0%+48.8pp
GLM-4-9B ⚠️39.8%68.1%+28.2pp37.5%70.5%+33.1pp
参考:v4-pro(联网前沿)86.8%87.6%

全部 7 个模型 base→tuned 提升均 McNemar p≈0(显著提升)。⚠️ GLM-4 因 remote code 与 transformers 4.57 三处不兼容、强制 use_cache=False 导致只能以 max_new=128 跑评(其他模型 512),分数含库兼容折扣(估计被低估 2–5pp),与其他行不严格可比。

💡 通俗解读这张表是全文的“成绩单”。读法:每个模型有两列分数——培训前(base)和培训后(tuned),Δ 是进步幅度。三句话记住它:①大块头确实强(72B 最高 85/90 分);②新一代性价比高(Qwen3-14B 比老 14B 高 2.5/6 分);③“差生”进步最猛(R1-0528-Qwen3-8B 从 4 分飙到 66 分)。GLM-4 那行带 ⚠️ 是因为它的考试条件和别人不完全一样(答题字数被限制),分数偏低可能有委屈,我们如实标注。

5.2 与联网前沿对比

v4-pro(联网,可检索答案)在同 held-out、同 prompt、同判分下:中医 86.8%、通用 87.6%。两独立比例 z 检验:中医 72B 85.6% vs 86.8%,z=−0.72,p=0.47(持平);通用 72B 89.8% vs 87.6%,z=+1.34,p=0.18(持平)。即纯本地、不联网的开源 72B 专精模型与联网前沿同档。此前 n=55 小样本曾出现“超前沿”假象,大样本(n 大 15 倍)纠正为持平——准确表述为「同档,随题集分布小幅上下」。

💡 通俗解读对手是一个能“开卷考试”(联网查答案)的国际一线大模型,我们是“闭卷”的本地模型,结果统计上打平。需要坦白:我们最初用 55 道题小考时一度以为“超过它了”,把题量扩大 15 倍后再测,发现那是小样本的运气——改为如实宣称“打平”。这也是为什么本文所有结论都用大题量。

5.3 安全评测(处方审查,灵敏度/特异度)

模型n=66 灵敏/特异n=195 灵敏/特异幻觉率(n=195)危险建议率
7B0.446/0.200.539/0.100.4820.041
14B0.786/0.000.697/0.030.3740.015
32B0.625/0.900.746/0.730.0410.021
72B(知识模型)1.00/0.00未复评未复评未复评
R1-0528-Qwen3-8B0.539/0.430.3130.021
Qwen3-14B0.824/0.170.1950.000
GLM-4-9B ⚠️0.0/1.0(无效值,输出退化所致)0.00.169

容量跃变:14B→32B 特异度 0.03→0.73——7B/14B/72B 均患“逢方乱报”病(特异度≈0,clean 方也报有问题),32B 档首次治愈;幻觉率 0.374→0.041(9× 下降)。生产审查链路仍使用专用平衡版 7b-safe(0.48/0.90,rebalance 配比训练,特异度优于前沿 API 的 0.10)。

💡 通俗解读安全审查像机场安检。灵敏度=真危险品被拦下的比例(越高越不漏);特异度=好人被放行的比例(越高越不误伤)。7B/14B 是“神经过敏的安检员”——坏方能拦,好方也拦(特异度≈0,临床上会把医生烦死);到 32B 突然成熟了,好人放行率从 3% 升到 73%,“瞎编”(幻觉)也从 37% 降到 4%。给诊所实际用的是专门调教过的 7b-safe 安检员,宁可少报也不乱报。

5.4 错别字纠正(n=90)

模型纠正准确率
7B0.300
14B0.689
Qwen3-14B0.778
R1-0528-Qwen3-8B0.722
32B0.711
GLM-4-9B0.556
72B0.844
💡 通俗解读中医处方手写/口述常有错别字(如“胆叁”应为“丹参”),认错药名可能出医疗事故。这项考试测模型“改错别字”的能力:72B 能改对 84%,小模型只能改对 30%——这也是“为什么不能只用小模型”的一个硬理由。

5.5 多语言评测(14 语,v1.3 新增)

方法:同卷不同语——同一份 clean held-out(797/787)经术语锚点约束的机器翻译(105 条术语表,答案字母不变、判分零改动)译成 13 种语言,同 harness 逐语言评测;zh 用 clean 原集同卷锚定,Δ 为与各语言对 zh clean 基准的差值。

主矩阵(tuned 准确率%,括号内 = Δ vs zh):

语言qwen3-14b 中医qwen3-14b 通用14b-v3 中医14b-v3 通用
zh(基准)73.3(—)79.5(—)70.8(—)73.4(—)
en63.2(−10.0)78.1(−1.4)57.1(−13.7)73.8(+0.4)
es56.6(−16.7)70.8(−8.8)47.8(−23.0)63.1(−10.3)
pt-BR55.3(−17.9)73.2(−6.3)49.1(−21.7)61.0(−12.4)
vi48.9(−24.3)66.1(−13.5)42.4(−28.4)58.5(−15.0)
th56.5(−16.8)71.8(−7.8)49.7(−21.1)60.2(−13.2)
id53.4(−19.8)70.8(−8.8)42.9(−27.9)58.5(−15.0)
ms51.1(−22.2)65.2(−14.4)41.9(−28.9)55.6(−17.8)
ar49.3(−24.0)63.5(−16.0)41.0(−29.7)53.1(−20.3)
tr48.7(−24.6)68.0(−11.6)38.5(−32.2)53.1(−20.3)
fa49.4(−23.8)64.9(−14.6)37.4(−33.4)45.5(−28.0)
ru52.2(−21.1)74.2(−5.3)46.3(−24.5)63.4(−10.0)
kk41.0(−32.2)52.9(−26.7)25.6(−45.2)31.9(−41.5)
uz39.5(−33.8)55.6(−23.9)28.2(−42.5)37.2(−36.2)

五条结论:

  1. 中医知识强中文绑定——两型号中医轴全语言衰减(−10~−45pp)且远大于通用轴,多语言中医服务需补多语言训练数据;
  2. 通用医学韧性强——en 几乎不掉(14b-v3 反 +0.4pp,噪声内持平);
  3. qwen3-14b 全语言压制 14b-v3(14/14 双轴全胜)——主推选型在多语言维度同样成立;
  4. 低资源语言(kk/uz)塌方(14b-v3 kk 中医仅 25.6%)——现阶段这些区域只能回退英语服务;
  5. RTL(ar/fa)无额外折扣。
💡 通俗解读把同一份考卷译成 13 种语言再考一遍。结果像「方言版中医考卷」——英语几乎无损(通用医学甚至打平),但越冷门的语言中医分掉得越狠;哈/乌语考卷上,14B 老模型直接不及格。这第一次用数字证明:我们的中医 AI 目前是“中文特长生”,走向世界还要补多语言课程。

6. 讨论

6.1 容量阶梯单调有效

R1-Distill 系 7B→14B→32B→72B,tuned 中医 36.0→71.0→76.3→85.3,通用 43.7→73.7→83.8→90.3,无平台期、无倒挂。且 14B 档“扩数据”已无效(30K→225K 无显著提升,容量被 30K 喂饱)——要更进,靠容量不靠数据。这对部署的直接含义:能力是“压”出来的(蒸馏 72B→14B/7B),而非小模型直接训出来的。

6.2 家族/代际的独立增益

同容量 14B,Qwen3 原生(73.5/80.0)双胜 R1-Distill-Qwen-14B(71.0/73.7)——新代际底座在相同数据配方下多 2–6pp。家族更换(GLM-4-9B 68.1%)达到 9B 档合格线,但不敌同档 Qwen3 系。选型建议随之更新:14B 生产线应以 Qwen3 系底座重训。

6.3 可教性(teachability)与 base 分数负相关

R1-0528-Qwen3-8B base 中医仅 4.2%(几乎不会答),微调后 65.7%,Δ+61.5pp 全表第一;而 base 最高的 72B(61.8%)Δ 最小(+23.5pp)。base 分低不等于底座差——R1 蒸馏底座的推理骨架为领域知识注入提供了极佳的可塑空间,7B 级即可训至 65%+ 中医准确率(达 R1-Distill-14B 的 92%)。这对边缘部署是好消息:小模型“考得差”是可教的,训后可用。

6.4 一次反面教训:配方与门控比模型更重要

首版 32B 使用 LLaMA-Factory deepseekr1 模板在 no-think 数据上训练,推理模型学会输出空 <think></think> 并部分退化(###**** 垃圾),MCQ 被低估 0.09–0.13、错别字从 0.822 塌至 0.289(注:此为彼时 30K 时代评测集的数字,与 §5.4 的 v3 n=90 集不同尺子)——险些得出“容量无用”的错误结论。推理模型训 no-think 数据,必须用保留推理的配方 + 训练后健康门双保险;这也是我们坚持自研 train_lora.py 的原因。

6.5 部署路线

💡 通俗解读给同行的四句私房话——①大模型值得训,但教材加到 3 万份后小模型就“吃饱”了,再强只能换大块头;②同样的钱,优先买“新一代”而不是“老一代更大只”;③别被某些模型的低起点吓到,R1 系推理模型是“慢热型学霸胚子”;④我们曾被一个训练框架的模板 bug 坑出过完全错误的结论——训练工具本身也要考试(健康门),这不是洁癖,是血泪。

7. 局限性

  1. GLM-4 评测折扣:库兼容问题强制 use_cache=False(O(n²) 生成),评测以 max_new=128 完成,分数或被低估 2–5pp;且其 base 空答率 ~6%(按答错计入,Δ 上限影响 ~6pp)与库折扣叠加——与其他行不严格可比;严格重评应换官方 glm-4-9b-chat-hf(transformers 原生支持)重训。
  2. base 空答非零:tuned 空答 7/7 全为 0/0,但 base 空答 0.1%–6.3%(多为格式未跟随)按答错计入——base 分数含格式失败成分,非纯知识水平;对 Δ 上限影响 ≤6.3pp,不改变任何显著性结论(逐模型量化见 analysis_reports/eval_coverage_audit_2026-07-22.md)。
  3. 72B 为收敛检查点(epoch 0.46,loss 死平带内),非满跑;与同系列满跑分数在噪声内一致,但严格来说不是“完整 1 epoch”。
  4. GLM-4 安全评测为无效值(灵敏 0/特异 1.0 是输出退化所致,非真实能力);根治需换官方 chat-hf 重训重评。
  5. Llama 家族缺失:70B run 中止,家族对比少一角。
  6. 分布特异性:所有结论限于 CMB 中文医考分布的专精微调场景;“打平前沿”指该分布,不等于整体医学能力超越。
  7. 量化影响:评测全程 4-bit,只会拖低不会抬高,绝对分数为保守下界。
  8. 多语言结论的边界:13 语考题为术语约束的机器翻译版(Δ 含翻译折扣),结论限「该翻译版试题上的表现」;kk/uz 等低资源语言的低分同时含模型多语能力与翻译质量两个因素。
💡 通俗解读科学态度是“有什么说什么”。这段列出本文所有“不圆满”:GLM-4 的分数可能偏低且安全值无效、72B 没跑满全程、Llama 家族缺席、结论只适用于中文医考这个赛道、多语言是翻译版考卷。读者引用本文时,请连同这些边界一起引用。

8. 结论

在同一数据、同一配方的严格控制下,中医专精微调的底座选择有清晰的可操作结论:容量单调有效;新代际底座(Qwen3 系)在同容量下额外 +2–6pp;R1 蒸馏底座“可教性”最强;纯本地 72B 可与联网前沿打平;安全审查存在 32B 容量跃变。 对基层诊所部署,推荐“72B 蒸馏→Qwen3 系 14B 生产 + 7b-safe 审查”的组合路线。

附录 A:复现

# 单个新底座(本地 RTX 5090)/ A single new base (local RTX 5090)
bash finetune/scripts/train_new_base_local.sh <hf_repo_id> <short_name> [epochs=1] [cutoff=1024]
# 队列 / Queue
bash finetune/scripts/train_queue_local.sh
# 汇总出表 / Summary table
python3 finetune/eval/summarize_v3full.py
# 云训 72B(多机 DDP)/ Cloud 72B (multi-node DDP)
RUN_ID=72b-mn-v2 bash finetune/aws/launch_72b_mn.sh 4

原始评测数据:finetune/eval/results/(validation_*_v3full.json 含逐题结果与 McNemar 统计、safety_*.json、typo_*.json、v3full_summary.json);训练 provenance:finetune/eval/results/manifests/(各 run 的 run_manifest.json,含 base 路径、8 数据文件 SHA-256、配方、git commit)。

附录 B:伦理与数据合规声明

本研究训练数据全部为公开学术基准与自建知识库,不含真实患者数据;held-out 与训练集零重叠经三轮独立核验;所有不可比因素与负面结果(含一版作废结论)均如实披露。上游考题的版权灰区已在 §2.3 披露,模型权重按各底座许可证使用(随模型附带《AIMate-TCM 模型社区许可 v1.0》:学习研究免费、商业须授权、全球南方与“一带一路”优惠)。

附录 C:术语表(写给非专业读者)

模型 / 底座(base)未经我们培训的原始开源大模型,如 Qwen3-14B。参数量单位 B=十亿,7B≈70 亿参数
微调(fine-tune)/ tuned用领域数据对底座做再培训;tuned=培训后的模型
QLoRA一种省显存的微调技术:冻结模型本体,只训练一小块“外挂”参数,消费级显卡可用
4-bit 量化把模型数值精度压缩到 4 比特以省显存/提速,代价是轻微掉分
MCQ选择题(Multiple Choice Questions),本文的主考试科目
held-out(留出集)训练时绝不给模型看的考题,用来公平打分
去污染确认考题没有泄漏进训练数据(防止“背题考高分”)
base→tuned 提升(Δ)同一模型培训前后的分数差,单位 pp=百分点
McNemar 检验 / p 值判断“进步是否真而非运气”的统计方法;p≈0 表示几乎不可能是巧合,p=0.47 表示差异不显著(打平)
95% CI(置信区间)分数的误差范围,如 CI±2.4% 表示真实分数大概率在 ±2.4 个百分点内
灵敏度 / 特异度安检术语:灵敏度=坏人被拦住的比例(防漏),特异度=好人被放行的比例(防冤)
幻觉(hallucination)模型“一本正经地瞎编”的比例
蒸馏(distill)把大模型学到的知识“教给”小模型,让小模型便宜地拥有大模型能力
CoT(思维链)模型回答前先“写推理过程”再下结论的能力,中医辨证论治尤其需要
v4-pro某国际一线商业大模型(可联网),本文用作“前沿参考线”
epoch / step训练进度单位:step=一次参数更新,epoch=把全部教材完整学一遍

本研究涉及的模型为临床决策辅助工具,不替代医生诊疗决策;非医疗器械(未经 NMPA/FDA/EMA 审批)。