黄力恒LIHENG HUANG

PROJECTS

项目实践

从可靠的数据处理,到可解释的分析与评价。以下项目涵盖数据工程、随机实验、生存建模与医学影像预测。

01 / 进行中 · 医学影像 · 跨中心模型评价

基于双区域纵向CT建模预测非小细胞肺癌新辅助免疫化疗后的病理淋巴结状态

2026.06 — 至今

研究问题

面向接受新辅助免疫联合化疗并完成手术的非小细胞肺癌(NSCLC)患者,研究治疗前后胸部 CT 中原发肿瘤与淋巴结的双区域特征,对患者级术后病理淋巴结状态(ypN)的预测价值。

已开展的工作

  • 围绕影像与掩膜几何质量、特征提取及队列清单进行数据审计,追踪预处理和局部表征中的信息损失。
  • 采用固定患者级折分、训练侧拟合和留一中心验证(LOCO),比较特征与模型路线,检查模型对中心差异的依赖。
  • 开展 Logistic 基线、单因素修复和 TabPFN 等候选比较,结合配对不确定性、校准与跨中心稳定性判断是否保留改动。

当前阶段

研究仍在推进,当前重点是可靠基线、信息损失定位与表征改进。现有候选尚不足以支持稳定采用,未确定正式采用模型。

02 / 数据工程 · Python · PostgreSQL · Streamlit

金融科技 KPI 自动化报表流程

2026.08 — 2026.09

问题

模拟香港无抵押分期贷款业务,将持续产生的客户、申请、放款和还款事件转化为口径一致、可追溯的日常业务指标。

方法

  • 使用 Python 和 PostgreSQL 组织 raw、staging、mart、audit 数据层,实现增量加载、事件版本处理与数据对账。
  • 在本地定时完成每日处理与修正窗口重建,仅将聚合指标同步至云端,为五页 Streamlit 看板提供数据。
  • 通过重复运行一致性、事务回滚和访问权限测试验证流程,并配置 GitHub Actions 自动化测试。

结果

已核验的项目快照覆盖 248 天、4,665 笔已放款贷款、9,470 万港元本金,完成 19 项测试。看板覆盖业务概览、信贷漏斗、资产与回收、贷款批次及渠道与数据质量。

以上均为合成数据与项目验收快照,不代表真实客户、实际放款规模或仪表板当前的实时数值。

03 / 实验分析 · 嵌套交叉验证 · AIPW

邮件营销 A/B 测试与策略评估

2026.08 — 2026.09

问题

邮件是否改善访问、购买和消费?在不发、男装邮件、女装邮件三种行动中,个性化选择是否比统一触达更有离线价值?

方法

  • 从 Hillstrom 的 64,000 条历史随机实验记录开展事后分析,进行数据质量检查、实验组平衡诊断与假设检验。
  • 采用嵌套交叉验证,将模型与策略选择限制在训练流程内;使用增广逆概率加权(AIPW)评价三行动策略。
  • 通过五个预设随机种子检查策略评价的稳定性,区分总体邮件效果与个性化选择的附加价值。

结果

男装邮件相对不发邮件组的两周人均消费提高约 0.77 美元(95% 置信区间:0.49–1.05 美元)。这一组间结果与“个性化是否优于统一触达”是不同问题;现有评价未证明个性化策略优于训练侧选出的最佳统一策略。

这是对历史实验的重新分析,而非新开展的线上 A/B 测试。不将不显著解释为策略等效。

04 / 方法研究 · 函数型数据 · Cox 生存模型

多元函数型生存数据的 Cox Filtration

2026.05 — 2026.07

问题

多导联心电等函数型数据具有高维、强相关的结构。如何在右删失生存结局下,学习不同函数之间共享及特有的风险成分,同时保留可追溯的解释?

方法

  • 将多尺度 filtration 表征扩展至 Cox 偏似然的得分与信息几何,比较 Fusion 与 Directional 两类分组机制,并逐层提取残余风险方向。
  • 通过保存基函数、递归映射、标准化参数与 Cox 系数,将拟合风险分数重构为“导联 × 时间”的载荷。
  • 使用 CODE-15 的十二导联心电数据开展多划分种子、五折及嵌套训练规模比较,并以数值与结构回归测试检查核心实现。

结果

公开仓库报告的研究包含 154,744 条心电记录与 7,888 例死亡事件。在完整训练规模下,Directional 与 Fusion 的平均成分数分别为 36.48 和 25.02,低于不共享函数型 Cox 的 72.00;观察到的判别表现相近。

上述为仓库报告结果,本次网站更新未重跑实验。相近的观察表现不等于统计等效;不同估计器及重复次数的结果仅作描述性比较。导联关联描述拟合模型结构,不代表生理连接或因果关系。

05 / 生存分析 · Landmark · Transformer

乳腺癌预后建模与疾病进展模拟

2025.04 — 2025.08

问题

如何利用随访信息建立预后模型,并在控制数据泄漏的评估流程中,比较不同序列模型与生存分析方法?

方法

  • 基于 MSK-CHORD 的 5,368 名乳腺癌患者纵向就诊记录,构建 Landmark 与 Transformer 流程,预测多个随访时点的后续生存风险;采用患者级划分和训练侧预处理。
  • 使用数值稳定的 Cox 偏似然进行训练,开展五折内部验证,并使用 SHAP 分析模型特征贡献。
  • 对疾病进展变量进行模型敏感性分析,观察输入变化对应的预测响应。

结果

五折内部验证 C-index 为 0.887 ± 0.009(均值 ± 标准差),用于评估模型的风险排序能力。

结果来自内部验证,不代表外部临床验证或临床部署效果。疾病进展变量的调整属于模型敏感性分析,不是已识别的因果干预效应。