关于高编码欺诈的检测:两步式无监督异常值检测方法
研究背景
医保部门的反欺诈一直是一个重要问题,大量可用数据使采用数据挖掘技术来解决这个问题成为可能。本期MEWS矩阵为大家带来经典文献《Data mining application to healthcare fraud detection: a two-step unsupervised clustering method for outlier detection with administrative databases》的解读。
本研究的目标是开发一种新的数据挖掘模型,利用医院出院表(HDC)在管理数据库中进行高编码欺诈检测。
研究方法
第一步
在完全无监督的假设下,根据医院的特点和治疗特定疾病的行为对医院进行K-means聚类。
应用主特征分析作为特征选择方法,重复200次,将出现次数最多的前n个特征作为最终选择的变量。
通过网格搜索来选择最优特征数量n和分组个数k,使得聚类结果的平均剪影宽度最大化。
通过欧氏距离自动将数据划分为k个可能的具有不同大小和密度的聚类群。并选择距离超过指定阈值的医院作为离群值。
第二步
验证高编码欺诈指标:专业化程度,收治患者数,并发症占比,高编码指数以及平均成本。通过可视化仪表盘显示各维度分布,并突出显示离群值位置。
验证异常行为是否可被患者群体复杂性所证明的变量:年龄、住院时长、伴随疾病、总费用。对比疑似医院与整体的指标分布,并根据医院指标和患者情况的交叉验证解释异常是否合理。
利用个人决策支持系统,逐个异常医院进行分析,借助可视化工具帮助审计人员验证识别出的异常值是否可用特定特征来解释,从而协助判断是否对疑似医院进行更深入的调查。
研究结果
局部距离分布函数左偏,最佳模型参数为k=6, n=20,共选出10个离群医院,选择其中三家医院作为范例应用,可视化展示每家医院(用垂直线表示)在整个种群中的各变量分布情况,并列出每个分析维度各离群医院所在的百分比位置。




鲁棒性测试
我们将算法直接应用到整个数据集上,结果于包含特征选择的结果一致,证明了方法的稳健性。此外,补充材料对不同参数设置下的结果进行了更深入的稳健性分析。
研究讨论
聚类算法的选择:
可替代的几种聚类算法有:层次聚类 (凝聚和分裂聚类) 的树状图,DBSCAN,SLINK,或基于深度学习的超参数选择和训练剪裁。限制:至多分离出数据中本质上可用的聚类,聚类形状更复杂且大多需要对聚类形状进行特定的假设或干预。而简单的k-means符合完全无监督假设,算法计算时间更快,对不同密度的聚类和高维数据的鲁棒性最强,可用在更广泛的自动选择参数的算法上来给医院聚类。
网格搜索的应用:
可以使算法灵活适应于不同的设置(样本大小小于、近似或大于维度数)。即便所分析的医院数量和待评估的可能组合数量可能会无限增长,搜索的计算强度随之增加,但由于变量数量受有限的DRG数量的限制,有效控制了计算开销,保证了用户对要评估的参数的信心,从而降低了对特征选择通道的需求。
改进方向:
使用更长时间段的原始数据可以更好地验证该方法的有效性。
将验证步骤包括在研究方案中,并将研究人员也包括在验证步骤中可以提升结果的信度。
考虑结合出院表以外的其他知识来源,例如借助电子医疗记录(EMRs)来更好地描述患者的健康状况和接受的治疗。
研究结论
本文主要新颖之处是:
定义了一种简单有效地识别在任何特定维度上都不够突出的异常值的方法,算法新颖,可规模化,易于解释;
定义了欺诈指标和检验患者复杂性的变量;
利用可视化工具辅助异常值的判断并直接控制假阳性异常值的风险;
在识别DRG异常编码行为方面有较好的应用前景,易于推广到任何类型的系统和任何感兴趣的疾病;
易于使用,不需要用户广泛干预或具备统计知识;
可以帮助审核人员减少初始筛选所需的时间以及由于不同审核员的技能不同而对结果产生的负面影响。
需要注意的是,基于模型得到的任何结论都不是对是否存在或者欺诈行为的明确判断,只是为审计人员提供一套有用的信息以简化评估过程,减少浪费在假阳性案例的努力的风险,但最终的判断仍然完全在用户手上。
参考文献
[1] Massi M C , Ieva F , Lettieri E . Data mining application to healthcare fraud detection: a two-step unsupervised clustering method for outlier detection with administrative databases[J]. BMC Medical Informatics and Decision Making, 2020, 20(1).
来源 | 健康界
版权归原作者所有,若有违规、侵权请联系我们

- 1


