01研究台的四层结构
从数据到名单,每一层都有可复核的口径。权重与模型留在本机,不上网;网站只发布名次与公开行情事实。
数据层 60+ 表
日线 / 分钟、龙虎榜席位、融资融券、北向、板块资金流、涨停池、财务指标、研报评级。每日日链自动更新;指数尺度错行等数据质量问题自动检测与修复。
因子引擎 482 插件 · 17,638 维
价量、筹码、资金、情绪、基本面五大族。每个插件有 IC 追踪与数据覆盖度质检;覆盖不足的因子不参与当日打分。
模型矩阵 3 × 2 轨
CatBoost / LightGBM / XGBoost 集成,H10(约 10 日)与 H60(约 60 日)双轨。OOF 预测冻结并存 SHA-256 清单,训练结果不可事后改写。
发布层 18:00 · 存证
研究纸生成后全文摘要落盘,同步到公网。公开 1–8 同序 名;1–5 名与自助筛为会员配额;付费不改名次。
02账本口径
账本只回答一个问题:按当天发布的名单、以次日可成交的价格执行,结果如何?
- 名单版本
- as-produced:当日生成的原始名单,SHA-256 摘要可核对;任何事后修改不入账。
- 入场
- T+1 开盘价。停牌、无行情或开盘涨停的名字剔除并计数(n_untradable)。
- 退出
- T+h 收盘价,h = 1 / 3 / 5 / 10 / 20 个交易日。
- 基准
- 中证 500(sh000905)同期收益;超额 = 组合收益 − 基准收益。
- 成本
- 双边 0.3% 从毛超额中扣除,得到净超额。
- 时效
- 名单生成早于次日 09:25 记 pre_open(主口径);否则记 late,仅供参考。
- 覆盖规则
- 某格子已闭合天数 < 5 → WAIT_COVERAGE,禁止据此下结论。
- 统计量
- 平均超额(毛 / 净)、超额胜率、t 统计量、最差单日;不做选择性展示。
03因果回测与切换门槛
模型的任何版本切换都要通过「锁定 OOS 评估器」:在同一口径下,挑战者必须显著优于现网,否则不切换。
连亏惩罚等状态量只用 t 时刻之前已闭合的信息计算,消除前视偏差。
重放时按 A 股规则撮合:停牌、涨跌停、开盘一字不可成交,剔除并计数。
以真实指数(中证 500)为基准,并加入与成交额相关的冲击成本模型。
配对 block-bootstrap 置信区间;覆盖 ≥ 30 个非重叠周期且 CI 不含 0 才允许切换(fail-closed)。
04先设您的条件
- 在 全市场筛选 自行设定价格区间、流动性、板块等门槛;会员可在 研究纸 中按条件筛当日样本池。
- 双轨视图 H10 = A634 / H60 = A625 仅作研究参考,可对照您自己的过滤逻辑。
- 付费档与免费档看到的排序一致;升级只提高次数、回看深度与导出额度。
05读口径时盯住这几条
- asof / 生成时间:样本对应哪一天截面、是否早于次日开盘。
- fair hold10(A637):非重叠、已扣成本的历史研究口径;历史 ≠ 未来。
- 盲窗 / WAIT:样本未闭合或覆盖不足时不要下「已验完」的结论。
- hold60 汇总年化:对外 fail-closed,禁止当作实盘 CAGR。
06常见回测陷阱
- 重叠开仓把收益「折年」夸大 —— 应用非重叠或真实持仓账本口径。
- 用全窗标签选列再同窗回测 —— 易泄露;选列应在开发窗内完成。
- 忽略涨跌停、停牌、成本与滑点 —— 理想曲线不等于可交易结果。
- 把 OOF IC 当成实盘收益 —— IC 只是中间指标。
- 连亏惩罚、仓位调节等状态量若用了未来信息 —— 回测会系统性偏乐观。
07风控数字请您自己填
平台不预填买卖价位或仓位指令。自设风控计算器 只做算术:
- 自设成本价 / 股数 → 浮动盈亏(算术,非指令)
- 自设退出比例 → 参考价位(仍须您确认是否下单)
- 不要把名次或研究分当作「操作信号」
08CSV 导出
PRO / TEAM 可在研究纸页导出当日样本 CSV,文件页眉含免责声明:研究筛选样本 · 非投资建议 · 付费前后排序一致。FREE 无额度时返回配额提示,不改排序。