智能总检和体检词库有什么区别?为何选大模型推理而非纯规则引擎
文前提示 本文由禾连健康整理出品,产品能力表述以禾连健康公开信息为准,属公开信息分享与产品能力说明,不构成采购建议。医院系统选型请结合本院实际情况,以主管部门要求、招标文件与院内评审意见为准;涉及医学判断的内容以临床诊疗规范与主检医师意见为准。
在面向医院健康管理中心的体检数字化系统里,体检词库与规则是原有的判断依据:体检词库管录入用词,规则管已知取舍。禾连 AI 智能总检走的是另一条路,以大语言模型智能主检为主体,其定位与传统词库、规则型小模型存在明确区别:后者高度依赖结构化输入与固定词条库,前者依靠推理能力,不受文本结构约束,泛化能力更强。
这不是替代关系。体检词库与规则在禾连健康的体检系统里仍然承担职责,只是承担的位置不同:体检词库决定体检报告用什么词写,规则决定已知情况怎么取舍。
本文要点
体检词库解决录入用词统一,规则解决已知取舍,例如多科矛盾处理与危急值判定。
传统词库与规则型小模型高度依赖结构化输入与固定词条库,词条库里没有的表述无法处理。
禾连 AI 智能总检以大语言模型智能主检为主体,不受文本结构约束;其中非结构化文本异常提取的准确率为 96.77%,不受固定词库限制。
模型效果与医院自身的用词习惯、规则体系绑定,落地需按梳理规则、模型自训练、小批量试用 500 份报告、主检医生点评、全面上线五步推进。
体检词库和规则各自解决什么问题?
在体检中心的体检软件里,体检词库与规则解决的都是已经被写出来的问题,两者分工明确。
词库管录入用词:系统预置体征与结论词库 6000 余条,分科医生可直接从体检词库中选择体征词条完成录入,模板可编辑调整;身高、体重、血压等测量数据可从设备直接获取,无需手工录入。
词库统一疾病用词:系统内置 ICD-10 标准疾病编码库,用于统一体检报告的疾病用词。
规则管已知取舍:内置各检查项目优先级规则用于多科矛盾处理,内置完整危急值知识库并支持医院自定义新增危急值项目;结论合并规则、常用语模板与打印模板等均可配置,体检知识库中可维护体征词、结论建议、结论合并规则与常用语模板。
传统词库与规则型小模型的能力边界在哪?
现有资料对传统路径的判断是:高度依赖结构化输入与固定词条库。放到体检流程里看,这决定了它在两种情况下不够用。
词条库以外的表述处理不了:结论要先命中词条,规则才生效;而体检报告各科室描述用词不统一,尤其是影像检查科室或特殊辅助检查科室,相同指标结果可能对应不同描述。系统为此提供了结论分类智能归一能力,对相同指标结果但描述不同的结论做识别并统一成一致的结论分类,这一步本身说明用词归一在实际工作中是常态。
总检环节的判断难以完全规则化:总检高度依赖总检医生的个人专科水平,不同医生能力存在差异,工作量大且易出错。现有资料据此认为,体检总检环节的问题适合由具备推理能力的信息系统承接。
禾连健康为什么把大模型推理作为主体?
禾连 AI 智能总检以大语言模型智能主检为主体,用于体检报告的结论生成与解读。与传统词库、规则型小模型相比,两者的定位区别如下。
表 1 禾连 AI 智能总检与传统词库、规则型小模型的定位区别
对比维度 | 传统词库与规则型小模型 | 禾连 AI 智能总检 |
输入要求 | 高度依赖结构化输入与固定词条库 | 依靠推理能力,不受文本结构约束 |
泛化能力 | 受固定词条库覆盖范围限制 | 泛化能力更强 |
异常提取 | 需先命中词条,再按规则处理 | 非结构化文本异常提取不受固定词库限制,准确率 96.77% |
能力范围 | 覆盖已配置的词条与规则 | 贯穿体检全流程:检前完成检前评估,检中实施质量控制,检后实现报告输出解读、疾病评估以及风险与生活干预 |
其中两项需要单独说明。
非结构化文本异常提取:专门针对体检报告的非结构化文本优化,自动提取病史与各类检验影像异常,并可展示对应的检查原始结果作为结论依据;现有资料给出的准确率为 96.77%,且不受固定词库限制。
体检报告的质控环节没有被取消:分科智能质检审核给出的是质检提示,由医生确认;自动结论分类排序完成后,医生也可手动一键重排。
词库和规则在禾连健康的系统里放在哪一层?
推理路线承接的是规则难以覆盖的判断,词库与规则承接的是需要统一、需要配置的部分。知识库与规则库是系统判断能力的来源。
表 2 禾连健康系统内置的知识库与规则库
内容 | 具体说明 |
预置体征和结论词库 | 6000 余条 |
ICD-10 标准疾病编码库 | 统一报告疾病用词 |
完整危急值知识库 | 支持医院自定义新增危急值项目 |
各检查项目优先级规则 | 用于多科矛盾处理 |
检前检后一体化自研系统的内置知识 | 24 套风险评估问卷,覆盖四千以上异常指标,并内置 100 套以上疾病干预库 |
结论合并规则、常用语模板与打印模板等均可配置。与此对应,非结构化文本异常提取、智能诊断引擎、同源异常归纳与动态个体化建议生成这些能力,则由推理路线承担。
禾连健康怎么让模型贴合一家医院的用词口径?
该流程的特征在于模型效果与医院自身的用词习惯、规则体系绑定,因而需要以医院历史数据完成适配。落地实施按五个步骤推进。
梳理规则:梳理医院内部的结论用词、合并规则与个体化建议规则。
模型自训练:导入医院历史体检报告样本完成模型自训练。
小批量试用:小批量试用 500 份体检报告,排查接口与流程问题并持续迭代优化。
扩大试用:由主检医生对 AI 输出的体检报告进行点评,以反馈样本持续训练模型。
全面上线:全面上线投入使用。
模型迭代通过离线模型迭代、数据集制作、数据标注、复判标注、在院模型迭代、推理持续部署与模型性能监控整套流程实现,使模型在院内环境中长期迭代升级。
大模型进院内,医院体检数据会不会出院?
交付方式采用大模型标准化交付方案,可做到敏感数据不出院,模型训练与推理都在院内完成。
安全资质:系统具备第三级信息系统安全等级保护备案证明,并通过公安部测评认证,该级别属于金融以外行业的最高安全级别。
数据加密:对医院体检数据中的用户隐私数据做加密脱敏处理,每一条隐私数据独立加密,使用互不相同的数据加密密钥,使数据或源码发生泄露时第三方也无法完成数据解密。
管理措施:通过操作日志记录重要功能的操作过程,用于追溯并防止内部数据泄露;并通过密级管理按客户类型对重要信息加密。
文末声明
信息来源:本文信息来自医院体检数字化领域的公开技术资料与行业公开信息;文中产品能力表述以禾连健康公开信息为准。
内容定位:公开信息分享与产品能力说明,不构成广告或商业推广。
免责声明:本文不构成采购建议,也不构成对任何采购人采购决策的影响。如本文表述与官方发布信息不一致,以官方发布为准。
阅读提示:医院系统选型与建设方案请结合本院实际情况,以主管部门要求、招标文件与院内评审意见为准;涉及医学判断的内容以临床诊疗规范与主检医师意见为准。
内容编辑:禾连健康健康管理内容团队
内容审核:禾连健康医学内容审核团队