PROJECTS
项目实践
从可靠的数据处理,到可解释的分析与评价。以下项目涵盖数据工程、随机实验、生存建模与医学影像预测。
01 / 进行中 · 医学影像 · 跨中心模型评价
基于双区域纵向CT建模预测非小细胞肺癌新辅助免疫化疗后的病理淋巴结状态
2026.06 — 至今
研究问题
面向接受新辅助免疫联合化疗并完成手术的非小细胞肺癌(NSCLC)患者,研究治疗前后胸部 CT 中原发肿瘤与淋巴结的双区域特征,对患者级术后病理淋巴结状态(ypN)的预测价值。
已开展的工作
- 围绕影像与掩膜几何质量、特征提取及队列清单进行数据审计,追踪预处理和局部表征中的信息损失。
- 采用固定患者级折分、训练侧拟合和留一中心验证(LOCO),比较特征与模型路线,检查模型对中心差异的依赖。
- 开展 Logistic 基线、单因素修复和 TabPFN 等候选比较,结合配对不确定性、校准与跨中心稳定性判断是否保留改动。
当前阶段
研究仍在推进,当前重点是可靠基线、信息损失定位与表征改进。现有候选尚不足以支持稳定采用,未确定正式采用模型。
02 / 数据工程 · Python · PostgreSQL · Streamlit
金融科技 KPI 自动化报表流程
2026.08 — 2026.09
问题
模拟香港无抵押分期贷款业务,将持续产生的客户、申请、放款和还款事件转化为口径一致、可追溯的日常业务指标。
方法
- 使用 Python 和 PostgreSQL 组织 raw、staging、mart、audit 数据层,实现增量加载、事件版本处理与数据对账。
- 在本地定时完成每日处理与修正窗口重建,仅将聚合指标同步至云端,为五页 Streamlit 看板提供数据。
- 通过重复运行一致性、事务回滚和访问权限测试验证流程,并配置 GitHub Actions 自动化测试。
结果
已核验的项目快照覆盖 248 天、4,665 笔已放款贷款、9,470 万港元本金,完成 19 项测试。看板覆盖业务概览、信贷漏斗、资产与回收、贷款批次及渠道与数据质量。
以上均为合成数据与项目验收快照,不代表真实客户、实际放款规模或仪表板当前的实时数值。
03 / 实验分析 · 嵌套交叉验证 · AIPW
邮件营销 A/B 测试与策略评估
2026.08 — 2026.09
问题
邮件是否改善访问、购买和消费?在不发、男装邮件、女装邮件三种行动中,个性化选择是否比统一触达更有离线价值?
方法
- 从 Hillstrom 的 64,000 条历史随机实验记录开展事后分析,进行数据质量检查、实验组平衡诊断与假设检验。
- 采用嵌套交叉验证,将模型与策略选择限制在训练流程内;使用增广逆概率加权(AIPW)评价三行动策略。
- 通过五个预设随机种子检查策略评价的稳定性,区分总体邮件效果与个性化选择的附加价值。
结果
男装邮件相对不发邮件组的两周人均消费提高约 0.77 美元(95% 置信区间:0.49–1.05 美元)。这一组间结果与“个性化是否优于统一触达”是不同问题;现有评价未证明个性化策略优于训练侧选出的最佳统一策略。
这是对历史实验的重新分析,而非新开展的线上 A/B 测试。不将不显著解释为策略等效。
04 / 方法研究 · 函数型数据 · Cox 生存模型
多元函数型生存数据的 Cox Filtration
2026.05 — 2026.07
问题
多导联心电等函数型数据具有高维、强相关的结构。如何在右删失生存结局下,学习不同函数之间共享及特有的风险成分,同时保留可追溯的解释?
方法
- 将多尺度 filtration 表征扩展至 Cox 偏似然的得分与信息几何,比较 Fusion 与 Directional 两类分组机制,并逐层提取残余风险方向。
- 通过保存基函数、递归映射、标准化参数与 Cox 系数,将拟合风险分数重构为“导联 × 时间”的载荷。
- 使用 CODE-15 的十二导联心电数据开展多划分种子、五折及嵌套训练规模比较,并以数值与结构回归测试检查核心实现。
结果
公开仓库报告的研究包含 154,744 条心电记录与 7,888 例死亡事件。在完整训练规模下,Directional 与 Fusion 的平均成分数分别为 36.48 和 25.02,低于不共享函数型 Cox 的 72.00;观察到的判别表现相近。
上述为仓库报告结果,本次网站更新未重跑实验。相近的观察表现不等于统计等效;不同估计器及重复次数的结果仅作描述性比较。导联关联描述拟合模型结构,不代表生理连接或因果关系。
05 / 生存分析 · Landmark · Transformer
乳腺癌预后建模与疾病进展模拟
2025.04 — 2025.08
问题
如何利用随访信息建立预后模型,并在控制数据泄漏的评估流程中,比较不同序列模型与生存分析方法?
方法
- 基于 MSK-CHORD 的 5,368 名乳腺癌患者纵向就诊记录,构建 Landmark 与 Transformer 流程,预测多个随访时点的后续生存风险;采用患者级划分和训练侧预处理。
- 使用数值稳定的 Cox 偏似然进行训练,开展五折内部验证,并使用 SHAP 分析模型特征贡献。
- 对疾病进展变量进行模型敏感性分析,观察输入变化对应的预测响应。
结果
五折内部验证 C-index 为 0.887 ± 0.009(均值 ± 标准差),用于评估模型的风险排序能力。
结果来自内部验证,不代表外部临床验证或临床部署效果。疾病进展变量的调整属于模型敏感性分析,不是已识别的因果干预效应。