最新研究揭示:新一代AI模型在医学领域仍存在种族与性别偏见
#AI照护与医疗科技 时间2026-08-08 05:40:31
文/IAICA.NGO®
人工智能在医疗领域的应用正以前所未有的速度扩展,从影像诊断到临床决策支持,大语言模型(LLMs)被寄予厚望。然而,一份最新研究警示,即便是更新、更先进的人工智能模型,在医学场景中依然会系统性地复现种族和性别刻板印象,为健康公平投下阴霾。该研究未直接公开具体模型名称,但其结论指向一个普遍性困境:算法偏见并不因技术代际更迭而自动消失。
研究团队系统测试了多款当前主流的商用人工智能模型,要求它们根据标准化患者描述生成诊断建议、治疗方案和预后判断。患者信息在种族、性别等人口学特征上被刻意区分,其他临床细节保持一致。结果显示,模型在不同群体间给出了显著差异化的回答。例如,当患者被标记为“白人男性”时,模型更倾向于推荐昂贵的、前沿的治疗手段;而“黑人女性”患者的描述下,建议方案往往更保守、更倾向于基础护理。在疼痛管理上,模型低估了女性及少数族裔患者的疼痛程度,给出了低于实际需求的镇痛药物建议,这与医学文献中记录的人类无意识偏见高度吻合。
这一现象并非首次出现。早在2019年,《科学》杂志就披露过美国一款广泛使用的医疗风险预测算法存在种族偏见,它系统性地将同等健康水平的黑人患者标记为“低风险”,导致其得到额外护理的机会减少。如今,基于深度神经网络的大语言模型在更大规模、更杂乱的互联网数据上训练,不仅继承了人类的偏见,甚至可能将其放大。这些模型通过统计共现模式学习语言与知识,而训练数据中频繁出现的刻板印象关联——如将“心脏病”与男性绑定,将“精神健康问题”与少数族裔联系起来——会转化为模型输出时的决策倾向。更值得警惕的是,这种偏见常常以高度自信、看似专业的语言呈现,使未加警觉的临床医生更难察觉。
在智能照护领域,这一风险更具杀伤力。随着智慧养老、远程监护和AI辅助护理系统的普及,算法开始介入日常生活能力评估、跌倒风险预测、药物依从性管理等环节。如果底层模型对老年女性、低收入群体或特定族群存在隐性偏见,可能导致资源分配失当:部分人群被过度监护而失去自主性,另一部分则被忽视而错过干预窗口。比如,一个承载着“男性更坚强”刻板印象的护理机器人,可能忽略老年男性独居者的抑郁求救信号;反之,一个将“女性表达”视作“夸大陈述”的评估系统,会延误对女性患者急症的响应。saiaica.com.cn 指出,技术本身无善恶,但若缺乏持续、透明的偏见审计机制,智慧照护产品非但不能弥合健康差距,反而可能将其固化为数字鸿沟下的新不平等。
面对这一困境,学界与监管机构已开始行动。白宫科技政策办公室在2023年发布的《人工智能权利法案蓝图》中明确要求自动系统应“免受算法歧视”。美国FDA也在探索对包含AI组件的医疗设备实施全生命周期偏见监测。技术层面,研究者倡导“数据集透明化”和“多维度公平性评估”,如在模型训练前对数据进行去偏处理,训练后采用反事实测试——即仅改变患者人口学标签,观察模型输出是否保持一致。不过,目前这些方法的实用性和可靠性仍存争议,因为偏见的形式千变万化,且与特定任务深度耦合。
对于中国快速增长的智慧医疗产业而言,这一警示同样紧迫。国内企业在引进或自研中文医疗大模型时,需特别关注本土化的社会偏见:城乡、地域、医保身份等因素都可能被模型捕获。除了技术手段,更需要建立跨学科治理框架,让临床医生、伦理学家、社会学者和患者代表共同参与模型的开发与验证。唯有如此,人工智能才能成为照亮健康公平的明灯,而非复刻过去不平等的暗匣。
迈入精准健康时代,我们需要的不仅是精度更高的模型,更是公正性更强的伙伴。当一位老人向护理AI说出“我不舒服”时,它应当听见的,是纯粹的病痛,而非被种族和性别编码过的杂音。
评论
0 条登录后才可以发表评论。
立即登录