医疗 AI 评估

医疗 AI 评估与建模

跨机构医疗 AI 项目,包含 NIH R01 文本评估和骨质疏松跨机构建模迁移验证。

医疗 AILLM Eval建模专家基准

问题

医疗 AI 如果没有清晰的文本评审标准、专家基准、缺失数据处理和跨机构漂移验证,结果会很脆弱。

工作流

  1. 01预处理 NIH R01 申请文本,并在受控条件下调用 6 款模型。
  2. 02收集专家教授评分作为人类基准,对比模型偏差与稳定性。
  3. 03搭建骨质疏松特征工程和集成模型流水线。
  4. 04在中美及跨机构数据差异下做迁移验证,优先使用低门槛生理特征。

证据

合作背景

项目与 UTHSC 和 St. Jude 领域专家合作,公开版保留敏感研究材料边界。

NIH R01 评估

基于 6 款模型和 23 份科研申请,与专家评分基准比较。

骨质疏松建模

跨国跨机构迁移验证处理数据标准不一、严重缺失和漂移问题。

边界

  • 不替代临床专家判断。
  • 公开站点不发布患者数据、原始申请文本、模型输出或在投论文。
  • 项目是 NIH R01 文本评估和骨质疏松建模,不写胰腺癌。

岗位映射

  • LLM Eval:把主观文本判断转为 rubric 与专家基准比较。
  • 医疗数据产品:处理缺失、漂移和低门槛临床特征。
  • AI 辅助决策:明确保留人类基准和复核边界。