基于大数据技术的智能化房颤专病数据库建设和应用
心房颤动(以下简称房颤)是临床上最常见的心律失常疾病之一,流行病学资料显示中国房颜总体患病率约为0.77%。房颤因心房丧失了收缩功能而引发极快且极度不规则的心跳频率四。其发病与年龄、饮酒、肥胖、长期精神紧张、高血压病、冠心病等多个基础疾病类型有关四。房颤的诊治关键在于对患者实现早期诊断,并予以长期规范化、个体化的治疗),进而预防严重并发症的发生。针对中国人群房颤的早期诊断,规范化、个性化治疗的临床研究相对较少,这与医院缺乏对该疾病临床数据长期统一的规范化记录,未形成高质量的疾病研究数据库有很大关联。
专科疾病临床数据长期统一的规范化记录,依赖于我国全面推进电子病历的政策。当前各家医院内部的信息系统正在进行着不同频率的迭代,这一过程中庞大的医疗数据被分散存储在医院内部的各项系统中,来源不一致,数据标准也不统一,这样的局面导致大量医疗数据未被有效整合,形成“数据孤岛”。国家政策层面非常重视基于真实世界数据开展临床研究,优化疾病诊疗策略,进而提高居民健康水平。随着2015年国务院发布了《关于促进大数据发展的行动纲要》和2017年原国家卫生计生委印发了《“十三五”全国人口健康信息化发展规划》,建设医疗大数据中心并助力科学研究提速,是当今国家的重要战略措施之一。此外,国家卫生健康委员会于2018年制定了《全国医院信息化建设标准与规范(试行)》,在新兴技术方面,强调要基于大数据、人工智能技术建设智能化专病数据库(以下简称专病库)。
截至2021年10月,上海交通大学附属胸科医院心血管内科建立的房颤专病库已经纳入自2015年1月起在本院就诊的5万余名患者。在强调“个体化诊疗”和“慢病管理”的时代,建设房颤专病库可帮助医生高效地总结治疗经验,挖掘潜在的科研方向。同时积累该疾病专有的随访数据,形成高质量的真实世界数据,赋能临床研究。
1专病库建设标准和架构
房颤专病库参考了国内和国际医疗行业的权威标准,例如:国家卫生健康委员会行业数据标准、 HL7CDA文档、中文医学主题词表(CMeSH)、《国际疾病分类第九版临床修订本手术与操作》(ICD9-CM-3)、第10版国际疾病分类(ICD-10)等。规范数据标准,建立医学术语的同义关联词表,其意义在于可以对多源异构的原始数据进行标准化的数据治理,并为后续数据应用提供统一的信息表达。例如,对于医疗文书中的诊断名称,医院内每个医生录入时的书写习惯和采用的词语往往是非统一、非标准的。房颤专病库进行数据治理时会通过自然语言处(natural language processing, NLP)技术将原始诊断名称标准化为ICD-10中的诊断名称,并关联其对应的ICD编码及其上位诊断名称,方便通过不同层次的标准诊断进行搜索和统计分析。
依据上述通用的行业标准以及房颤相关的诊疗指南、临床路径,确定了房颤数据模型。该模型包括18个模块,976个字段。每个字段由以下属性描述所组成:模块名称、子模块、字段编码、字段名称、值域、数据级别、系统来源等,见表1。字段可以分为通用字段和专病字段两部分,通用字段即全部疾病都涉及的信息,比如:患者人口学信息、检查检验结果等;专病字段则是针对房颤设计的特殊字段,例如:射频消融术的相关内容、各项房颤抗凝血评分等。
根据抽取方法的不同和难度,专病库字段分为3个级别:
(1)第1级别数据(即L1字段)。原始信息为结构化信息,只需要进行简单映射或过滤就可以进行精准抽取。例如性别、年龄等人口学信息或者药品医嘱、检验结果等。
(2)第2级别数据(即L2字段)。原始信息存在于大段的文本中,需要经过后结构化、归一化等NLP技术才能进行精准抽取。例如从入院记录的主诉、现病史中抽取症状和发病时间,从超声心动报告中抽取室间隔厚度和心室射血分数等。
(3)第3级别数据(即L3字段)。在L1和L2字段的基础上增加逻辑计算才能抽取的字段。例如“是否出现术后并发症”字段,需要比较出院诊断与入院诊断得到住院期间新增诊断,再判断其是否属于术后并发症集合;同时,从术后的病程记录中结构化抽取术后并发症;对得到的两个集合求并集得到该字段的最终结果。
图1为房颤专病库的技术架构,基础架构部分采用分布式存储和计算架构,离线部分采用Hadoop、Spark等技术并行处理海量的医疗数据,数据治理部分采用基于TensorFlow的深度学习NLP算法进行结构化和归一,在线应用部分采用MongoDB,ElasticSearch,K8S,Docker等分布式存储、搜索和服务架构,保证应用层的高效和稳定。基于大数据基础架构,平台将医院原始数据库通过数据治理与加工形成专病库标准病历库。在此基础上,研发了多个专病数据库应用模块,包括科研项目管理、数据管理、病历搜索、人群探索、时间轴、统计分析以及随访管理等。同时,数据安全策略与机制贯穿整体数据生产加工流程及产品应用阿。
2数据的采集、处理与加工
在真实世界研究中,需要搜集患者就诊过程中的重要医疗数据,而这些数据大多散落在医院内部的各个业务系统中,想要有效率地搜索和分析这些数据非常困难。即使获取了数据也要面对人工录入的时间成本高、错误率高、难以共享等很多问题,最终导致科学研究的进展缓慢1.因此,基于大数据和人工智能技术对多源异构的医疗数据进行数据处理与加工,形成高质量、可计算的专病库数据,可有效加速疾病研究。
2.1数据采集
首先,通过数据库同步技术将院内的医疗数据,包括HIS、LIS、超声、放射、内镜等影像系统、电子病历系统(EMR)、护理系统、重症监护系统、手术麻醉系统等接入存储服务器。再经过抽取、同步、汇集等环节,最终实现针对医院多源异构数据的采集和汇聚。
2.2数据处理
数据采集完成后进入数据处理环节。数据处理包括数据脱敏、数据关联、数据清洗、数据质控、数据标准化等。数据脱敏:
将患者姓名、身份证号、家庭地址等敏感信息去除。通过对敏感字段值进行md5不可逆加密达到脱敏的目的。数据关联:通过患者ID,就诊ID将不同原始表的数据进行关联,形成信息相对完整的业务数据表。数据清洗:主要针对不完整的、错误的、重复的数据进行清洗,保证数据的一致性,处理无效值和缺失值等。数据质控:通过上万条质控规则进行数据质量控制,包括数据类型校验、有值率合理性校验、取值合理性校验、字段冲突校验、医学规则校验等。数据标准化:基于NLP技术,将疾病、手术、用药、检查、检验等5大类实体的原始值映射到基于ICD-9、 ICD-I0、ATC、LONC改进的标准术语体系。
2.3数据加工
基于数据治理之后的数据,按照专病库数据模型的设计进行L1/L2/L3字段的加工。L1字段使用简单的映射和过滤即可完成。
针对L2字段研发了基于字典匹配的实体识别+基于BERT BiLSTM-CRF8的实体识别+规则匹配推理的混合模型。基于字典匹配的实体识别保证了现有医学术语库可以得到应用,同时如果遇到模型无法识别的术语可以快速补充。
BERT-BiLSTM-CRF是目前效果最好的中文命名实体识别(named entity recognition,NER)模型,它可以召回不完全与字典项匹配但是语义上匹配的实体,BERT BiLSTM-CRF模型可以与字典匹配法互为补充。基于识别出来的不同类型的实体,通过匹配预定义医学规则可以得到不同类型的结构化字段。该混合模型可以同时兼顾召回率与准确率,经过抽样评估房颤专病库中的全部L2字段的召回率和准确率都达到了95%以上。图2为基于该混合模型从消融手术记录中抽取结构化字段的示例。
L3字段在L1和L2字段的基础上,进行逻辑运算得到,包括与、或、非、并集、交集、时间线比较、过滤、如果-那么等。
全部字段生产完成后,通过人工与机器相结合的方式进行数据质量评估,对于不符合要求的字段迭代优化词典、规则、逻辑运算策略等,直到数据质量完全达标。
上述数据生产流程每7d自动调度一次,以保证新增医疗数据可以及时更新到专病数据库中。
3专病库特色功能
数据库字段加工完成之后,将数据导入MongoDB分布式非关系型数据库与ElasticSearch分布式搜索引擎。同时,基于K8S+Docker的分布式服务架构,开发了科研项目、数据管理、病历搜索、人群探索、时间轴、统计分析以及随访管理等功能,方便用户基于专病库进行灵活的数据挖掘和科研项目管理。
病历搜索支持关键字搜索、条件树搜索及事件搜索3种方式。每种方式适用的场景不同,关键字搜索是从全部病历中进行匹配,命中的病历都返回,比较适合数据探查等重召回的场景。条件树搜索适用于患者或者病历维度多条件匹配但是与时间无关的场景,比如医生想从近5年住院期间诊断为“阵发性房颤”的患者中筛选出口服过“利伐沙班”,并且服用药物剂量为每日10mg的患者,可以通过图3的搜索条件完成。事件搜索适用于需要对患者或者病历在时间线上进行多个条件的逻辑判断的场景,比如医生的某项临床试验需要纳入“口服利伐沙班后的1h至第7d内有出血表现的患者”,可以通过图3的搜索条件完成。上述3种搜索方式能够满足不同需求场景下的患者筛选需求,极大地节约了医生时间,提高了科研产出效率。
时间轴功能将患者的全部医疗数据抽象为临床事件,然后将不同类型的临床事件以时间序列的形式进行“可视化”,时间轴上每个点代表一个临床事件,包括诊断轴、药物治疗轴、手术轴、心电图指标变化趋势轴等。通过时间轴功能医生能够很容易观察患者重点临床事件和指标之间的时序关系。通过对专病库上全部患者临床事件序列的模式挖掘可以发现数据背后隐含的科学规律,为优化疾病诊疗路径提供新思路。
在专病库平台内完成科研项目建立后,可在随访项目中设置基于时间轴的各类随访问卷、不良事件和随访任务提醒,并设置前瞻性研究中病例报告表(CRF表单)的数据抽取规则,表单数据可被系统自动或半自动填写,从而提升随访效率和随访数据输入的准确率。
4专病库应用与展望
截至2021年10月,上海交通大学附属胸科医院房颤专病数据库已纳入5万余名患者的临床诊疗数据。专病库上已经开展的研究共18项,其中包括16项回顾性研究及2项前瞻性临床研究。研究方向覆盖房颤的发病机制、危险因素、治疗效果分析、导管消融策略优化、术后并发症预测等多个方面。
上海交通大学附属胸科医院心血管内科经过多年探索与总结,在房颤导管消融的治疗策略及关键技术的使用上积累了较多的临床实例经验,在全国成立了20余个房颤治疗分中心。未来将推动全国房颤治疗分中心的房颤专病库建设,将分散于不同医院、不同信息系统中的医疗数据经过同样的标准化治理与加工流程,形成标准统一的专科数据库群。通过集中汇集或者多方安全计算技术,连通主中心与多个分中心的数据网络。基于数据网络开展大规模的真实世界多中心研究,分析不同治疗方案的优劣性,优化诊疗路径和临床指南,提高临床疗效。同时,加强患者随访,着重改善房颤患者的预后,长期推动中国医疗卫生事业在创新研究的道路上飞速发展。
来源 | 健康界
版权归原作者所有,若有违规、侵权请联系我们

- 1


