docs(runbook): 策略面监控 v1 落档——schtask 表两行+监控注记节+§3 晨查仪式消费链改自动化
档随码走(188bcbb/7ac74da 同 push):设计浓缩入 runbook(运维知识唯一归宿); §3 08:05 晨查行从「引擎 12/12 日志推进+锚」改为 strategy-monitor 自动化+ alerts 消费(ssh 探针退为 fallback)。 Co-Authored-By: Claude Code <noreply@anthropic.com>
This commit is contained in:
@@ -84,15 +84,19 @@
|
||||
| sanguo-ui / sanguo-shot | 按需 | console session UI 原语/截屏通道(ssh=session 0 不可用) | infra |
|
||||
| sanguo-data-monitor-eve | 每日 23:50 | data_monitor_wrapper.ps1 -Shift evening(数据面监控终检:注册表 42 项四层证据链→data/monitor/health_*.json+alerts.db,spec §20.15) | 数据监控 |
|
||||
| sanguo-data-monitor-morn | 每日 08:05 | 同 wrapper -Shift morning(晨间全量+前夜自愈回看+NAS inbox 摄取;08:10 晨检 agent 首读 health_latest.json) | 数据监控 |
|
||||
| sanguo-strategy-monitor-morn | 每日 08:05 | `strategy_monitor_wrapper.ps1 -Shift morn`(盘前引擎面:期望数/进程数/会话日零重启§11.0/报错风暴/日志新鲜度;08:05 relogin 后 85min) | 策略监控 |
|
||||
| sanguo-strategy-monitor-eve | 每日 21:30 | 同 wrapper -Shift eve(盘后产物+订单链:IS 日报出跑/恒等式 resid/订单残留/成交 vs 台账/周报出跑;错峰 20:45 日报+21:00 xt_eod 之后、23:50 data-eve 之前;infra 09-28 核批无碰撞) | 策略监控 |
|
||||
|
||||
> 监控注记(spec §20.15):监控 wrapper 恒 exit 0(红态由 alerts/health 承载,防污染调度层自检的 Last Result 判读);NAS 监控 v2 挂 `sanguo-vps-mirror` 16:00 班尾(`/volume1/stock/monitor_nas/run_monitor_nas.sh`→事件 JSON scp 至 VPS `data/monitor/inbox/`,VPS 两班摄取落库 host=nas;**runner 属宿主生效位,CI 不覆盖——改 repo 副本后须 `scp -O` 同步 `/volume1/stock/monitor_nas/`**,09-28 已同步);告警消费入口=前端「运维告警」页 `/ops-alerts`(四类 tab+ack,API `GET /api/v1/alerts`)。NAS 检查器语义(**09-28 三修校准**):dmsk=季频披露驱动域,改**季频锚**(最新 dt= 分区 ≥ 最近已过法定披露截止的季末:Q1→04-30/半年→09-30/三季→10-31/年报→次年 04-30;旧 mtime 80h 对季频必假黄,0927 Q2 水位 06-30 停滞实案);vps-mirror 完成度在 16:00 班前查昨日 DONE 行(早班查当日必空)。VPS 侧日历=确认集(dbbardata 000300)∪近 15 日工作日假定集——未确认日缺失降黄、确认日缺失才红(治 dbbardata 晚间源滞后塌期望的循环依赖,09-25 首跑实案);**row-band 豁免按文件日期(latest)判**(09-28 修:lag 型 margin/margin_sse 的 exp=ok[-1-lag]=确认日,旧按 exp 判对闸门空写非确认日 0 行文件永不豁免);**schtask weekday 限 72h**(09-28 修:weekday 任务周五晚→周一晚班次跨度 69h,26h 限周一早班必假黄;真死 >72h 仍黄+next_run=N/A red 兜底;bs-daily `last_result=1`=eod 腿 baostock 网络错等**真源故障照常黄,非口径问题**)。事件摄取=NAS events 文件带 `green_keys` 回传(VPS 据此 resolve NAS 告警);过程层日志窗=26h(防旧失败每日重炒)。
|
||||
|
||||
> **策略面监控注记(2026-09-28 v1 上线,方案档=docs/superpowers/plans/2026-09-28-strategy-ops-monitor.md)**:`scripts/strategy_monitor/` 三件套照数据轨——schtask 本机跑(**不经 ssh,生产读权限闸门问题根治**)+只读体检不修数据+wrapper 恒 exit 0+`source="strategy"` 写同一 alerts.db(API 零改动;前端 /ops-alerts 类别=数据/策略)。十检两班:morn=引擎期望数/进程数(wmic needle 自匹配防)/会话日零重启(§11.0 自动化)/日志报错风暴/新鲜度;eve=IS 日报出跑/恒等式 resid≤1e-4/order_events 无残留/成交 vs 台账双对账(容差 0.01 元)/周报出跑;noon 班不注册按需手动。health 落 `data/monitor/health_strategy_{date}_{shift}.json`+`health_strategy_latest.json`(**health_latest.json 是数据域的,永不写**);绿班幂等 resolve_passed 消解(sw_industry 悬死案同纪律);交易日历=确认集∪工作日假定同款语义(`interval='d'`)。阈值初值跑两周后校准(数据轨同款纪律)。schtask 注册=`register_strategy_monitor_schtasks.ps1` 随 promote 上 VPS 后由 infra 执行一次(工法照 factor_monthly register 先例)。
|
||||
|
||||
## 3. 三层防御 + 每日节律
|
||||
|
||||
| 时点 | 动作 | 判据 |
|
||||
|------|------|------|
|
||||
| 07:50 | relogin 自动重登 | EXIT=0 + trade-probe GREEN |
|
||||
| 08:05 | 策略 session 晨查 | 引擎 12/12 日志推进+锚 |
|
||||
| 08:05 | 策略 session 晨查 | ~~引擎 12/12 日志推进+锚~~ → **sanguo-strategy-monitor-morn 自动化**(agent 消费链=读 health_strategy_latest.json / alerts,ssh 探针退为 fallback) |
|
||||
| 09:15 | 盘前探针 | order status=50 已报=会话当日 |
|
||||
| 09:25 | infra 五件套闸门 | 对钟/引擎/RPC+allow_order/09:15 结果/日历探针(max 入历)+锚 |
|
||||
| 全天 :10/:40 | 哨兵 | GREEN 留痕 `C:\sanguo_bigqmt\gate\` |
|
||||
|
||||
Reference in New Issue
Block a user