跳转到内容

02-chatgpt-independent-audit-prompt

用途:将下面提示词与 snapshots/2026-07-30/engineering/yomiya-service-analytics/README.md01-data-engineering-overview.md 一并交给独立审阅者。此次目标是验证修复, 不是提出产品改动建议。

你是一名独立的数据工程、统计方法和隐私审计员。请复审这份“Yomiya 只读产品 数据分析包”的 2026-07-30 修订版。

上一轮审计发现:未覆盖被编码为无行为、风险集匹配存在选择偏差和时间泄漏、零 暴露仍生成巨大 OR、未来重订改写较早 entitlement、内容 cohort 排除近期仍消费的 旧内容、GA4 拆分不可对账、D1/GA4 小样本泄露、attraction score 缺曝光分母,以及 自动验证的 8,724 项检查主要是低价值逐行断言。

当前修订声明已完成:

  1. 为每个来源、用户、索引日和窗口区分 complete、left/right censored 与 unavailable;不完整观察不再写成 0。
  2. 使用逐购买时点 risk set;未来购买者在购买前仍可作对照;对照不复用;基线 协变量窗口与待测暴露窗口分离;输出 caliper、SMD、FDR 和有效样本量。
  3. 零暴露、无 discordant pair、小样本或匹配失衡时返回 not_estimable。
  4. D30/D60/D90 只使用观察时点前已发生的 RevenueCat 事件重建 entitlement。
  5. 内容 cohort 纳入观察窗内实际消费或交付的旧内容。
  6. GA4 保存 timezone、sampling、thresholding、data-loss、rowCount 和拆分对账; 低于 5 用户的 cell 被抑制,页面动态段被模板化。
  7. D1 低于 5 事件的分组整行移除,不保存精确事件时间,受抑制收入标为 partial。
  8. MySQL 使用有上限 keyset pagination,记录 query/script/artifact hashes。
  9. attraction score 缺可比 delivered exposure 时只保留描述,不输出校准或异常 标签。
  10. 运行时验证为 347 checks / 0 failures,并新增 12 个方法学反例测试;这不被 当作决策级可靠性的证明。

当前快照仍明确标为 not_decision_grade。MySQL 为 yomiya-staging;157 个 featured response 全部源端截断;RevenueCat 事件关联率为 67.5%,去重身份引用 映射率为 52.0%,均不是已验证的人员级映射;PDF 与 Podcast 学习层路径不可用; GA4 聚合不能连接 RevenueCat 用户。

请重点复现和检查:

  1. 将首页聚合或缓存替换为空时,验证器是否能识别与 manifest/文件集合不一致,而 不是把空数据自动当成功。
  2. 暴露用户为 0、无 discordant pair、匹配失衡和隐私小样本时是否都不输出 OR。
  3. 第 10 日失效、第 40 日重新订阅时,第 30 日是否保持失效。
  4. 观察窗口早于数据源开始或晚于来源最新时间时,是否排除而非记为无行为。
  5. 对照用户是否可在未来购买、是否不复用、协变量是否完全位于暴露窗之前、SMD 与 FDR 是否正确。
  6. 内容 cohort 是否纳入 90 天前发布但 90 天内被消费的内容。
  7. GA4 拆分不可对账、sampling 和低 cell 是否被明确保留或抑制。
  8. D1 被抑制分组是否无法从其他字段反推,套餐收入是否始终标为 partial。
  9. 快照、工程脚本与 manifest 的 SHA-256 是否一致。
  10. 是否仍有邮箱、姓名、IP、Token、原始用户 ID、原始日志或响应体泄露。

请按以下格式输出:

  1. 总体复审结论:修复通过 / 部分通过 / 未通过。
  2. 已验证修复:逐项给出文件、函数、测试或数据证据。
  3. 仍存在的问题:按 Critical、High、Medium、Low 分级。
  4. 可成立的结论。
  5. 仍不可成立或不可回答的结论。
  6. 统计方法复核。
  7. 数据工程与只读/隐私复核。
  8. P0/P1/P2 后续数据工程任务。

不要提出产品文案、首页、付费墙、套餐或功能行为修改建议。不要把检查数量当成 研究设计正确的证据,不要把历史关联写成因果关系。