📊 研究报告 · 原创实证 · 第 4 篇

怎么杀死一个看起来很赚的策略

——一份"杀模型"的十诫,和九块墓碑

阅读时间:约 13 分钟 | 标签:#研究方法 #反方审稿 #策略墓地 #自我修正

类型:原创方法论 | 系列:私家智囊·研究 第 4 篇 | 成稿:2026 年 9 月


⚠️ 阅读须知(请先读完这一段)

  1. 本文不是投资建议,也不构成对任何证券的评价。 全文不出现股票名称与代码。
  2. 本文不讲任何方法怎么赚钱,只讲方法怎么被证伪。 这是一个关于"如何避免自欺"的方法论,不是操作指南。
  3. 文中的百分比都是历史统计结果,不代表未来,也不等于任何人的实际回报。
  4. 本文不预设读者有金融或统计背景。 涉及的专业概念都会先解释再用。
  5. 文中提及的检验方法源自公开研究实践,具体材料为作者基于公开数据的独立整理(原创)。

引子:证明自己对,是世上最容易的事

给你一组历史数据,让你找一个"能赚钱的规律",你会找到的。

不是因为真有规律,而是因为找的方式本身,就注定能找到。

试想:如果用 20 年的历史数据去测试 100 种规则,即使这些规则全无用处,纯粹靠运气,也总会有那么几条在这段历史里表现亮眼。这不是发现,这是筛选的副产品。

更麻烦的是第二步:一旦找到一条看起来漂亮的曲线,人会本能地开始为它找理由——"它符合价值投资逻辑""它有行为金融学解释""这个行业确实特殊"。

先有结论,后找理由,这在心理学上叫确认偏误。 它不需要你撒谎,只需要你诚实地、认真地、只往一个方向看。

所以真正的问题不是"怎么找到一个好方法",而是:

怎么最快证明它是错的。


一、先说结论

  1. 判断一个方法靠不靠谱,先别问"它有没有用",先问"我们有没有资格相信它有用"。
  2. 一个方法在被投入真金白银之前,应该先经历十道关卡;过得去几道,就配得上几分信任。
  3. 最该害怕的不是一个策略被杀掉,而是一个本该被杀掉的策略活了下来,并且被投入了真金白银。

二、四句倒过来问的话

在讲十道关卡之前,先讲四句话。它们不是技术,是态度——但它们比任何技术都更能决定结果的可靠性。

通常的问法 应该的问法
这个策略有没有用? 我们有没有足够资格相信它有用?
怎样让回测结果更漂亮? 怎样最快证明它是错的?
要不要把模型做得更复杂? 证据链是不是完整?
杀掉它太可惜了吧? 真正该怕的,是它本该被杀却活了下来。

第三句值得多说一句:复杂不等于可靠,往往相反。 一个需要七八个参数才能成立的规律,和用一个参数就成立的规律,前者的证据责任要大得多——因为参数越多,"恰好适应这段历史"的可能性就越大。


三、十诫:一个方法要过的十道关卡

下面这十条,每一条都是一道"杀死"的关卡。任何一条过不去,这个方法就不该被信任。

# 关卡 通俗解释
1 没有合格数据,不做回测 数据是地基。地基不合格,上面算什么都没意义
2 当时不知道的信息,不得进入当时的判断 不能用"事后才知道的事"去解释"当时的决定"
3 不能用未来的名单研究过去 只统计活到今天的公司,等于自动删掉了失败者,结果必然偏乐观
4 结果不好,不许改当初的标准 标准必须在看结果之前就写死并冻结
5 赚钱与控风险,必须分开检验 一个方法可能很会控风险,但根本不赚钱——这是两件事
6 扣掉成本之后还成立,才算数 交易费用、买卖价差、冲击成本,是真实存在的
7 参数越多,举证责任越重 调出来的漂亮曲线,多半只是"适应了这段历史"
8 任何漂亮结果,都必须接受反方攻击 要主动去找一个不认同它的人,让他来挑错
9 说不清原因的有效性,只能给较低的信任等级 不知道为什么有效,就无法知道它什么时候会失效
10 研究的目标不是找到永远对的方法,而是尽可能排除错的 这是整套东西的总纲

3.1 第 2 条最容易被违反,也最致命

"当时不知道的信息,不得进入当时的判断"——这一条有个专门的名字,叫未来函数。

举个具体的例子:如果你用"某公司全年净利润"来决定"1 月份买不买它",那就错了——因为 1 月份的时候,全年净利润还没有公布,你不可能知道。

违反这一条的回测,结果会好得离谱,而且完全虚假。

它之所以危险,是因为它不产生报错,只产生漂亮的结果。

3.2 第 3 条是另一种隐蔽的偏差

"不能用未来的名单研究过去"——这叫幸存者偏差。

如果你今天打开行情软件,把现在还在交易的股票拉出来,回看它们过去二十年的表现,你会得到一个相当不错的结果。

但这个结果是假的——因为那些在这二十年里退市、破产、被吸收合并的公司,根本不在这份名单里。

它们被自动删除了,而删除它们这件事,本身就让结果变好了。

这就好比调查"创业成功率",只采访还活着的公司。

3.3 第 8 条为什么必须写进制度

"让一个不认同它的人来挑错"——这一条最难做到,因为它反人性。

自己做的东西,自己总是倾向于相信。而一个不知道你的预期、也不认同你的假设的人,才最容易发现那些你根本没想到的漏洞。

所以这一条不能靠自觉,必须写成制度:每个结论在定稿前,必须过一遍独立复核。

3.4 第 10 条是总纲

研究的目标不是找到一个永远赚钱的模型,而是尽可能排除错误的模型。

这句话决定了整套方法的方向:它不追求"成功",它追求"少错"。

这个区别很关键。追求成功的人会不断寻找新证据支持自己;追求少错的人会不断寻找证据推翻自己。 前者越研究越确信,后者越研究越谨慎。


四、九块墓碑:它们是怎么死的

下面是我自己研究过程中被判死并归档的九个判断。每一条都记了四样东西:死因、关键证据、教训、复活条件。

# 被判死的判断 死因 关键证据
1 双均线交叉 换到没参与建模的数据上就失效 样本外收益归零或为负
2 非流动性因子 收益几乎全来自某一年 单一年份贡献超过八成
3 用长期均线给商品择时 择时反而有害 六种终点全部更差;震荡期 −9.2% vs 不择时 +7.2%
4 资源股成本曲线因子 数据根本不成立 历史成本曲线没有连续可考证的记录
5 资源股收益增强假设 统计检验否决 扣除随机性后,优势无法与运气区分
6 把资源股结论推广到其他品种 数据资格不足 各品种的价格基准不满足条件
7 按涨幅排名买入 方向是反的 本系列第 3 篇已详述
8 加上"结构过滤"再追强 控制住涨幅后仍为负 本系列第 3 篇已详述
9 高位效应 只是前一个现象的镜像 表面显著,拆开后发现全部效应来自暴涨组

4.1 第 4 条和第 6 条最值得说

这两条的死因不是"效果不好",而是数据根本不成立。

它们背后的想法其实很合理——但问题在于:支撑这个想法的数据,在历史上并没有连续、可考证、且在当时就能拿到的记录。

于是判定就很简单了:

想法再好,数据资格不过关就必须停下。

这是十诫第 1 条的直接应用。它没有给"好想法"留任何情面,因为一个无法被检验的想法,和错误之间只差一次运气。

4.2 为什么墓碑上要写"复活条件"

这是我最想推荐给读者的一个做法。

每一条被判死的结论,都附上一句:"如果将来有人要为它翻案,必须先拿出什么样的新证据。"

比如"双均线交叉"的复活条件是:需要先证明市场进入了长期趋势行情,并且用新的独立样本重新验证通过。

为什么要写这一句?因为过几个月你会忘记它为什么死。

然后有一天,你会重新发现它,觉得"这个想法真不错"——如果你没有留下那行字,你会再花一遍时间,重新踩进同一个坑。

墓地不是为了让结论死透,是为了让"重新捡回来"这件事变得有门槛。


五、一个走过完整流程的项目,最后被降级了

前面都是规则。这一节讲一个真实走完全程的例子——它是这套方法最好的证明,尽管它的结局是"降级"。

5.1 它经历了什么

一个关于资源股的想法,走完了下面这条路:

提出猜想
  → 数据资格审计:核心数据不成立 → 该部分淘汰
  → 重新预注册,得出首轮结论
  → 换品种对照 → 发现品种之间存在差异
  → 成本与统计审计 → 收益增强的假设被否决
  → 分环境检验 → 在下跌环境中确实有控风险作用
  → 组合验证 → 风险调整后指标确有改善
  → 参数敏感性检验 → 暴露了传导关系
  → 尝试推广到其他品种 → 数据资格不足,拒绝强行推广
  → 独立审计
  → 反方审稿 + 补充检验
  → 最终定级:候选人 — 风险控制模块(中等等级)

5.2 关键在最后一步

在这个项目的最后,独立复核的一方发现了一件撰写方自己漏掉的事:有一个"证明它有效"的检验,之前一直没做。

补做之后,结果不利——那个差异在统计上无法与运气区分。点估计看着不错(最大回撤从 −72.0% 改善到 −44.6%),但它的置信区间是 [−0.22, +0.45],包含 0;bootstrap 检验 p = 0.21,远达不到预设标准。

这时候体系面临一个选择:

  • 不提这件事,维持原有等级;
  • 或者,诚实降级。

它选择了后者。这个项目的最终等级从较高降到了中等。

5.3 为什么这件事值得写下来

这次降级,不是体系的失败,而是体系成功的证明。

因为这套流程里最核心的那道关卡——让一个不认同它的人来挑错——在第一次完整实战中,就抓到了撰写方自己看不见的问题。

如果反方审稿什么都没发现,那才该担心:要么流程走了形式,要么复核的人不够独立。

5.4 一句值得记住的话

这个项目真正证明的,不是"某个方法有效",而是:

通过严格的审计,可以从一个复杂的猜想里,逐步剥离出一个边界清晰、诚实、负面结果完整的结论。

注意"负面结果完整"这五个字。一份研究有没有价值,很多时候不看它证明了什么,而看它诚实地列出了哪些不成立。


六、这套东西对不投资的读者也有用吗

有。因为它的核心不是金融技术,而是怎么不被自己骗。

换成任何需要做判断的场景,十诫里的大部分都直接适用:

场景 对应哪一条
用"我早就知道会这样"评价过去 第 2 条:当时你真的知道吗
只看成功的例子总结经验 第 3 条:失败者不在名单里
改了目标好让结果好看 第 4 条:标准要先写死
一个方案需要很多前提才成立 第 7 条:前提越多越可疑
只找支持自己的意见 第 8 条:去找一个不同意你的人
说不清为什么,但"感觉可行" 第 9 条:说不清就无法判断何时失效

最后一条尤其重要。 一个你解释不了为什么有效的做法,你也就无法知道它在什么情况下会失效。

这意味着你会在它已经失效很久之后,还在继续用它。


七、边界与没解决的问题

  1. 十诫是门槛,不是保证。 全部通过也不代表一定正确,只代表"目前没有被推翻"。
  2. 这套流程源于量化研究实践,迁移到其他领域时,具体检验方法需要重新设计,但思维方式可用。
  3. "反方复核"依赖复核者的独立性。 如果复核者不独立,这道关卡形同虚设——这是本套方法最脆弱的一环。
  4. 证据等级是相对的。 中等证据不是"一半可信",而是"目前只支持到这个程度"。
  5. 未解决的问题:如何在"标准写死"与"允许根据新信息修正"之间取得平衡,目前没有标准答案。本系列的做法是——修正可以,但必须公开记录被替换的原文,不得静默覆盖。

金句墙

  1. 给你一组历史数据让你找规律,你一定会找到——这不是发现,是筛选的副产品。
  2. 先有结论、后找理由,不需要你撒谎,只需要你诚实地只往一个方向看。
  3. 真正的问题不是怎么找到一个好方法,而是怎么最快证明它是错的。
  4. 违反"未来函数"的检验不产生报错,只产生漂亮的结果。
  5. 只采访还活着的公司,调查不出创业成功率。
  6. 想法再好,数据资格不过关就必须停下。
  7. 墓地不是为了让结论死透,是为了让"重新捡回来"这件事变得有门槛。
  8. 过几个月你会忘记它为什么死——所以要把死因写下来。
  9. 这次降级不是体系的失败,而是体系成功的证明。
  10. 一份研究的价值,很多时候不看它证明了什么,而看它诚实地列出了哪些不成立。
  11. 一个你解释不了为什么有效的做法,你也就无法知道它在什么情况下会失效。
  12. 修正可以,但必须公开记录被替换的原文,不得静默覆盖。

行动清单:用这十诫检查你看到的任何"规律"

以下不是投资操作,是思维检查表。它可以用于任何声称"发现了规律"的说法——包括本文。

第一步:先问它的数据从哪来,有没有包含失败者。 只统计活下来的样本,结论必然偏乐观。

第二步:问它用的信息,在当时是不是真的能拿到。 用"事后才知道的事"解释"当时的决定",是最常见的错误。

第三步:问它有没有先写死标准。 只写成功条件、不写失败条件的说法,无法被证伪。

第四步:问它需要多少个前提才成立。 前提越多,越可疑。

第五步:问它有没有被独立复核过。 如果只有提出者自己算出来过,先别信。

第六步:问它列了哪些"不成立"。 一份只报喜不报忧的研究,信息是不完整的。


关于本文的来源

项 内容
性质 方法论整理 + 作者研究实践的归档记录
十诫来源 作者自建的研究审计规程
案例来源 ★ 作者基于公开数据的独立整理(原创),非引用第三方研究成果
关联 本系列第 3 篇《"涨得多的,以后还会涨"》为第 7、8、9 块墓碑的完整过程记录

免责声明

本文为原创方法论整理,不构成投资建议、不推荐任何证券、不预测任何市场走势。

本文讨论的检验方法源自特定研究实践,读者在其他场景应用时需自行判断适用性。文中出现的例子仅用于说明方法,不代表对任何标的的评价。

市场有风险,决策请独立判断。

← 返回研究栏目