主要内容
MIT研究团队与合作者发现,医疗领域的AI可解释性工具效果因用户差异显著。非专业人士借助AI辅助提升诊断准确率,但主要依赖模型输出;初级护理提供者则在无解释时表现最佳。该研究发表于《Nature Medicine》,聚焦皮肤病诊断场景中AI的应用。
可解释AI(XAI)通过热力图、相似病例图像或大语言模型解释等方式,帮助用户评估模型输出。MIT团队测试了不同界面:非专业人士需判断痣是否癌变,初级护理提供者则进行鉴别诊断。
所有可解释方法均提升了非专业人士的准确率,主要帮助识别非癌性痣。公平约束模型(减少深肤色偏见)也改善了诊断效果,但非专业人士过度依赖模型,错误输出对其影响远大于正确输出的帮助。LLM解释最易导致依赖,即使错误也更易被信任。
斯坦福大学助理教授Roxana Daneshjou指出,医疗知识有限的患者最易受错误解释影响。MIT的Ghassemi教授强调,设计AI系统需平衡性能提升与自动化偏差,重视“锚定效应”的影响。