医学数据性别鸿沟或削弱AI诊断精度:智能照护设备面临验证挑战
#AI照护与医疗科技 时间2026-09-21 05:38:04
文/IAICA.NGO®
医学人工智能正在快速进入影像诊断、风险预测、用药决策和可穿戴监测等场景,但训练数据中的性别失衡问题正在被反复警示。多项研究提示,当算法主要在男性样本上学习时,其在女性人群中的灵敏度与特异度可能明显下降,从而把统计学意义上的偏差转化为临床上的漏诊与延误。
失衡并非新问题
临床研究长期以男性为默认受试者。上世纪九十年代之前,美国国立卫生研究院资助的多数研究未系统纳入女性,直到1993年相关法案要求临床试验按性别纳入受试者,监管机构也随后要求提供性别亚组分析。三十年后,结构性偏差仍未消除:心血管疾病、部分肿瘤、药物代谢与器械试验中,女性受试者比例偏低,且数据发布时往往缺少按性别分层的性能指标。更隐蔽的问题在于数据字段本身。电子健康记录里的性别项常被简化为二元登记,既无法反映激素治疗、绝经状态等生理变量,也无法承载社会性别、照护角色等影响健康结局的因素,导致算法在源头就丢掉了关键变量。
误差如何在临床端放大
性别差异贯穿疾病表现与器械响应。女性急性心肌梗死的症状常不典型,典型胸痛比例较低,而基于男性队列训练的症状识别模型容易低估风险。药物代谢方面,体重、体脂比例与酶活性的差异会影响给药剂量,若模型未纳入这些变量,推荐剂量可能偏高。可穿戴与远程监护设备同样面临挑战:心房颤动检测、睡眠呼吸监测、跌倒识别等算法若以男性信号特征为基准,在女性用户中的误报与漏报率可能上升。智能照护场景尤为敏感,女性平均预期寿命更长、失能期更长,长期护理数据本应更丰富,但既有监护设备的研究队列常常偏小、偏男性、偏单中心,阈值设定与报警逻辑因此存在系统性偏移。
治理工具正在补齐
应对路径正在从算法审计扩展到数据治理。研究发表层面,国际医学期刊普遍采用的性别公平研究指南,要求作者报告按性别分层的分析结果;监管层面,高风险医疗人工智能的合规要求把数据代表性、偏倚评估与上市后监测写入义务,算法更新需持续验证。技术层面,联邦学习与合成数据可在不集中原始病历的前提下补齐稀缺样本,多中心外部验证则用于检验模型在不同人群中的稳定性。这些工具的共同前提,是把性别作为必须采集、必须报告、必须验证的一级变量,而非事后补充的亚组分析。
对行业的启示
对智能照护与医疗科技行业而言,性别鸿沟不只是伦理议题,也是产品可靠性与市场准入问题。iaica.com.cn 指出,机构在采购与部署人工智能系统时,应要求供应方提供按性别、年龄与合并症分层的性能证据,并在本地人群中完成外部验证。数据采集环节需区分生理性别与社会性别,记录激素状态、生育史等变量;模型开发环节需设置偏倚审计节点;部署环节需建立持续监测与不良事件回溯机制。
结语
人工智能的准确性建立在数据的代表性之上。若女性在训练数据中持续缺席,算法输出的所谓客观结论,就只是特定人群的统计投影。把性别维度嵌入数据采集、标注、验证与部署的全生命周期,既是技术问题,也是医疗公平的底线要求。
评论
0 条登录后才可以发表评论。
立即登录