discipline/rounds/round-03-probabilistic-bench.md
📑 本页目录
轮次记录 · Round 3 · 概率方法库 + DSF-Bench + 出生检测落地
1. 目标与选题
- 选题:RQ-C1(分布交付)、RQ-C2(校准维护)、RQ-D2(基础模型评估初验)。
- 用户需求(2026-08-10):粒度细化下新对象出生检测与增长曲线预测(RQ-A5/B5/B6) 已由用户侧先落地为草案,本轮一并收口。
2. 背景与相关文献
- 概率预测范式:L-P-01/02;conformal 工程化:L-P-06/07/08;评估指标:L-E-01/03/04。
- 出生检测与曲线预测:扩散模型(L-TS-08)、结构化类比(L-J-02)、 时序基础模型零样本(L-ML-04/05)、变化点(支柱 2)。
3. 框架变更(Decision)
| # | 决策 | 落点 |
|---|---|---|
| D15 | 分布交付规范生效:决策场景 → 默认分位集 + 交付物清单 + 禁止项 | protocols/distribution-delivery.md |
| D16 | 校准维护协议生效:监控→触发→重校准循环 + conformal 工程化清单 | protocols/calibration-maintenance.md |
| D17 | DSF-Bench v0.1 建立:统计基线 + 分布评分 + 组合对照 + 扩展模型槽 + 活数据机制 | benchmarks/dsf-bench.md、scripts/dsf_bench.py |
| D18 | 知识架构模块化:_architecture + methods/ 七支柱拆分 + protocols/ 独立 + 上下文预算 | _architecture.md、methods/、protocols/ |
| D19 | 出生检测收口为学科协议 + Case 0 工程原型(用户侧落地,本轮并入记录) | protocols/emergence-detection.md、app/forecasting/emergence.py |
4. 实践产物与结果
4.1 分布交付与校准维护(RQ-C1/C2 · answered)
- 分布交付规范:5 类决策场景(库存/产能/预算/SLA/定价)→ 默认分位集; 必交预测分布;禁止只交点预测或单指标裁决。
- 校准维护协议:PIT/可靠性图/滚动覆盖率监控;PSI/BOCPD 漂移检测; conformal 选型与重校准触发清单。
4.2 DSF-Bench v0.1(RQ-D2 · in_progress)
- 数据:ETTh1/ETTh2(公开,小时级);本地榜单信号自动摄入(当前不足 100 点,跳过)。
- 模型:naive/snaive/mean/drift/ETS(固定参数)+ 简单平均组合; 分布由残差 bootstrap 生成,按 pinball/QS/MASE 评估。
- 关键结果(详见 benchmarks/dsf-bench.md):
- naive/snaive 在两个数据集上分位评分均优于固定参数 ETS;
- 简单平均组合被 mean/drift 拖累(组合需要修剪/加权 → RQ-D1 实证入口);
- 运行时约 3 分钟(可接受)。
- 边界:时序基础模型槽已定义接口,当前环境(1GB 内存)无法运行 torch, 如实标记「待运行」;ETS 为固定参数弱化版,优化版列入 v0.2。
4.3 出生检测落地(RQ-A5 · answered 草案)
- 学科协议 protocols/emergence-detection.md(用户侧完成,本轮纳入记录)。
- 工程原型 app/forecasting/emergence.py +
scripts/forecast.py emergence: watchlist 指标(首现/斜率/加速)+ Logistic 曲线拟合演示。 - 局限已诚实记录:当前 6 个映射领域非"新生领域",演示机制而非真实出生事件; 首现事件用计数增量近似,精确做法(逐批 app id 比对)列入待办。
5. 评估
- 达标:RQ-C1/C2 answered(协议可执行);RQ-D2 初验完成(统计基线 + 结果 + 边界如实); RQ-A5 落地(协议 + 原型 + 讨论记录);模块化达标(_architecture 规则 + 拆分完成)。
- 未达标:基础模型对比未运行(环境限制,非方法问题);组合修剪/加权未实证(列入 RQ-D1)。
6. 未决问题
- Q11 组合修剪/加权(中位数组合、剔除劣模型)在 DSF-Bench 上的实证(RQ-D1)。
- Q12 优化版 ETS/ARIMA 与基础模型槽的运行环境(≥4GB 内存)。
- Q13 本地榜单信号积累到 ≥100 点后自动进入 DSF-Bench(活数据机制验证)。
- Q6/Q7/Q8/Q9 延续(代理效度参考标准、截断检测自动化、案例库格式、关键词词典维护)。
7. 下一轮建议(Round 4 候选)
- 组合协议实证(推荐):RQ-D1 —— 在 DSF-Bench 上对比简单平均 vs 中位数组合 vs 修剪组合,给出首条组合实证结论。
- AI 原生需求案例:RQ-B2/B3 —— GPU/token 需求的截断校正 + 冷启动实例(Case 1/2)。
- 粒度拆分试点:RQ-B5/B6 —— 软件开发拆 2-3 个子领域,登记出生表,试跑 watchlist。
8. 版本号与 changelog
- 版本:v0.2 → v0.3。Changelog 见 rounds/README.md。