怎么杀死一个看起来很赚的策略
——一份"杀模型"的十诫,和九块墓碑
目 录
- ⚠️ 阅读须知(请先读完这一段)
- 引子:证明自己对,是世上最容易的事
- 一、先说结论
- 二、四句倒过来问的话
- 三、十诫:一个方法要过的十道关卡
- 3.1 第 2 条最容易被违反,也最致命
- 3.2 第 3 条是另一种隐蔽的偏差
- 3.3 第 8 条为什么必须写进制度
- 3.4 第 10 条是总纲
- 四、九块墓碑:它们是怎么死的
- 4.1 第 4 条和第 6 条最值得说
- 4.2 为什么墓碑上要写"复活条件"
- 五、一个走过完整流程的项目,最后被降级了
- 5.1 它经历了什么
- 5.2 关键在最后一步
- 5.3 为什么这件事值得写下来
- 5.4 一句值得记住的话
- 六、这套东西对不投资的读者也有用吗
- 七、边界与没解决的问题
- 金句墙
- 行动清单:用这十诫检查你看到的任何"规律"
- 关于本文的来源
- 免责声明
类型:原创方法论 | 系列:私家智囊·研究 第 4 篇 | 成稿:2026 年 9 月
⚠️ 阅读须知(请先读完这一段)
- 本文不是投资建议,也不构成对任何证券的评价。 全文不出现股票名称与代码。
- 本文不讲任何方法怎么赚钱,只讲方法怎么被证伪。 这是一个关于"如何避免自欺"的方法论,不是操作指南。
- 文中的百分比都是历史统计结果,不代表未来,也不等于任何人的实际回报。
- 本文不预设读者有金融或统计背景。 涉及的专业概念都会先解释再用。
- 文中提及的检验方法源自公开研究实践,具体材料为作者基于公开数据的独立整理(原创)。
引子:证明自己对,是世上最容易的事
给你一组历史数据,让你找一个"能赚钱的规律",你会找到的。
不是因为真有规律,而是因为找的方式本身,就注定能找到。
试想:如果用 20 年的历史数据去测试 100 种规则,即使这些规则全无用处,纯粹靠运气,也总会有那么几条在这段历史里表现亮眼。这不是发现,这是筛选的副产品。
更麻烦的是第二步:一旦找到一条看起来漂亮的曲线,人会本能地开始为它找理由——"它符合价值投资逻辑""它有行为金融学解释""这个行业确实特殊"。
先有结论,后找理由,这在心理学上叫确认偏误。 它不需要你撒谎,只需要你诚实地、认真地、只往一个方向看。
所以真正的问题不是"怎么找到一个好方法",而是:
怎么最快证明它是错的。
一、先说结论
- 判断一个方法靠不靠谱,先别问"它有没有用",先问"我们有没有资格相信它有用"。
- 一个方法在被投入真金白银之前,应该先经历十道关卡;过得去几道,就配得上几分信任。
- 最该害怕的不是一个策略被杀掉,而是一个本该被杀掉的策略活了下来,并且被投入了真金白银。
二、四句倒过来问的话
在讲十道关卡之前,先讲四句话。它们不是技术,是态度——但它们比任何技术都更能决定结果的可靠性。
| 通常的问法 | 应该的问法 |
|---|---|
| 这个策略有没有用? | 我们有没有足够资格相信它有用? |
| 怎样让回测结果更漂亮? | 怎样最快证明它是错的? |
| 要不要把模型做得更复杂? | 证据链是不是完整? |
| 杀掉它太可惜了吧? | 真正该怕的,是它本该被杀却活了下来。 |
第三句值得多说一句:复杂不等于可靠,往往相反。 一个需要七八个参数才能成立的规律,和用一个参数就成立的规律,前者的证据责任要大得多——因为参数越多,"恰好适应这段历史"的可能性就越大。
三、十诫:一个方法要过的十道关卡
下面这十条,每一条都是一道"杀死"的关卡。任何一条过不去,这个方法就不该被信任。
| # | 关卡 | 通俗解释 |
|---|---|---|
| 1 | 没有合格数据,不做回测 | 数据是地基。地基不合格,上面算什么都没意义 |
| 2 | 当时不知道的信息,不得进入当时的判断 | 不能用"事后才知道的事"去解释"当时的决定" |
| 3 | 不能用未来的名单研究过去 | 只统计活到今天的公司,等于自动删掉了失败者,结果必然偏乐观 |
| 4 | 结果不好,不许改当初的标准 | 标准必须在看结果之前就写死并冻结 |
| 5 | 赚钱与控风险,必须分开检验 | 一个方法可能很会控风险,但根本不赚钱——这是两件事 |
| 6 | 扣掉成本之后还成立,才算数 | 交易费用、买卖价差、冲击成本,是真实存在的 |
| 7 | 参数越多,举证责任越重 | 调出来的漂亮曲线,多半只是"适应了这段历史" |
| 8 | 任何漂亮结果,都必须接受反方攻击 | 要主动去找一个不认同它的人,让他来挑错 |
| 9 | 说不清原因的有效性,只能给较低的信任等级 | 不知道为什么有效,就无法知道它什么时候会失效 |
| 10 | 研究的目标不是找到永远对的方法,而是尽可能排除错的 | 这是整套东西的总纲 |
3.1 第 2 条最容易被违反,也最致命
"当时不知道的信息,不得进入当时的判断"——这一条有个专门的名字,叫未来函数。
举个具体的例子:如果你用"某公司全年净利润"来决定"1 月份买不买它",那就错了——因为 1 月份的时候,全年净利润还没有公布,你不可能知道。
违反这一条的回测,结果会好得离谱,而且完全虚假。
它之所以危险,是因为它不产生报错,只产生漂亮的结果。
3.2 第 3 条是另一种隐蔽的偏差
"不能用未来的名单研究过去"——这叫幸存者偏差。
如果你今天打开行情软件,把现在还在交易的股票拉出来,回看它们过去二十年的表现,你会得到一个相当不错的结果。
但这个结果是假的——因为那些在这二十年里退市、破产、被吸收合并的公司,根本不在这份名单里。
它们被自动删除了,而删除它们这件事,本身就让结果变好了。
这就好比调查"创业成功率",只采访还活着的公司。
3.3 第 8 条为什么必须写进制度
"让一个不认同它的人来挑错"——这一条最难做到,因为它反人性。
自己做的东西,自己总是倾向于相信。而一个不知道你的预期、也不认同你的假设的人,才最容易发现那些你根本没想到的漏洞。
所以这一条不能靠自觉,必须写成制度:每个结论在定稿前,必须过一遍独立复核。
3.4 第 10 条是总纲
研究的目标不是找到一个永远赚钱的模型,而是尽可能排除错误的模型。
这句话决定了整套方法的方向:它不追求"成功",它追求"少错"。
这个区别很关键。追求成功的人会不断寻找新证据支持自己;追求少错的人会不断寻找证据推翻自己。 前者越研究越确信,后者越研究越谨慎。
四、九块墓碑:它们是怎么死的
下面是我自己研究过程中被判死并归档的九个判断。每一条都记了四样东西:死因、关键证据、教训、复活条件。
| # | 被判死的判断 | 死因 | 关键证据 |
|---|---|---|---|
| 1 | 双均线交叉 | 换到没参与建模的数据上就失效 | 样本外收益归零或为负 |
| 2 | 非流动性因子 | 收益几乎全来自某一年 | 单一年份贡献超过八成 |
| 3 | 用长期均线给商品择时 | 择时反而有害 | 六种终点全部更差;震荡期 −9.2% vs 不择时 +7.2% |
| 4 | 资源股成本曲线因子 | 数据根本不成立 | 历史成本曲线没有连续可考证的记录 |
| 5 | 资源股收益增强假设 | 统计检验否决 | 扣除随机性后,优势无法与运气区分 |
| 6 | 把资源股结论推广到其他品种 | 数据资格不足 | 各品种的价格基准不满足条件 |
| 7 | 按涨幅排名买入 | 方向是反的 | 本系列第 3 篇已详述 |
| 8 | 加上"结构过滤"再追强 | 控制住涨幅后仍为负 | 本系列第 3 篇已详述 |
| 9 | 高位效应 | 只是前一个现象的镜像 | 表面显著,拆开后发现全部效应来自暴涨组 |
4.1 第 4 条和第 6 条最值得说
这两条的死因不是"效果不好",而是数据根本不成立。
它们背后的想法其实很合理——但问题在于:支撑这个想法的数据,在历史上并没有连续、可考证、且在当时就能拿到的记录。
于是判定就很简单了:
想法再好,数据资格不过关就必须停下。
这是十诫第 1 条的直接应用。它没有给"好想法"留任何情面,因为一个无法被检验的想法,和错误之间只差一次运气。
4.2 为什么墓碑上要写"复活条件"
这是我最想推荐给读者的一个做法。
每一条被判死的结论,都附上一句:"如果将来有人要为它翻案,必须先拿出什么样的新证据。"
比如"双均线交叉"的复活条件是:需要先证明市场进入了长期趋势行情,并且用新的独立样本重新验证通过。
为什么要写这一句?因为过几个月你会忘记它为什么死。
然后有一天,你会重新发现它,觉得"这个想法真不错"——如果你没有留下那行字,你会再花一遍时间,重新踩进同一个坑。
墓地不是为了让结论死透,是为了让"重新捡回来"这件事变得有门槛。
五、一个走过完整流程的项目,最后被降级了
前面都是规则。这一节讲一个真实走完全程的例子——它是这套方法最好的证明,尽管它的结局是"降级"。
5.1 它经历了什么
一个关于资源股的想法,走完了下面这条路:
提出猜想
→ 数据资格审计:核心数据不成立 → 该部分淘汰
→ 重新预注册,得出首轮结论
→ 换品种对照 → 发现品种之间存在差异
→ 成本与统计审计 → 收益增强的假设被否决
→ 分环境检验 → 在下跌环境中确实有控风险作用
→ 组合验证 → 风险调整后指标确有改善
→ 参数敏感性检验 → 暴露了传导关系
→ 尝试推广到其他品种 → 数据资格不足,拒绝强行推广
→ 独立审计
→ 反方审稿 + 补充检验
→ 最终定级:候选人 — 风险控制模块(中等等级)
5.2 关键在最后一步
在这个项目的最后,独立复核的一方发现了一件撰写方自己漏掉的事:有一个"证明它有效"的检验,之前一直没做。
补做之后,结果不利——那个差异在统计上无法与运气区分。点估计看着不错(最大回撤从 −72.0% 改善到 −44.6%),但它的置信区间是 [−0.22, +0.45],包含 0;bootstrap 检验 p = 0.21,远达不到预设标准。
这时候体系面临一个选择:
- 不提这件事,维持原有等级;
- 或者,诚实降级。
它选择了后者。这个项目的最终等级从较高降到了中等。
5.3 为什么这件事值得写下来
这次降级,不是体系的失败,而是体系成功的证明。
因为这套流程里最核心的那道关卡——让一个不认同它的人来挑错——在第一次完整实战中,就抓到了撰写方自己看不见的问题。
如果反方审稿什么都没发现,那才该担心:要么流程走了形式,要么复核的人不够独立。
5.4 一句值得记住的话
这个项目真正证明的,不是"某个方法有效",而是:
通过严格的审计,可以从一个复杂的猜想里,逐步剥离出一个边界清晰、诚实、负面结果完整的结论。
注意"负面结果完整"这五个字。一份研究有没有价值,很多时候不看它证明了什么,而看它诚实地列出了哪些不成立。
六、这套东西对不投资的读者也有用吗
有。因为它的核心不是金融技术,而是怎么不被自己骗。
换成任何需要做判断的场景,十诫里的大部分都直接适用:
| 场景 | 对应哪一条 |
|---|---|
| 用"我早就知道会这样"评价过去 | 第 2 条:当时你真的知道吗 |
| 只看成功的例子总结经验 | 第 3 条:失败者不在名单里 |
| 改了目标好让结果好看 | 第 4 条:标准要先写死 |
| 一个方案需要很多前提才成立 | 第 7 条:前提越多越可疑 |
| 只找支持自己的意见 | 第 8 条:去找一个不同意你的人 |
| 说不清为什么,但"感觉可行" | 第 9 条:说不清就无法判断何时失效 |
最后一条尤其重要。 一个你解释不了为什么有效的做法,你也就无法知道它在什么情况下会失效。
这意味着你会在它已经失效很久之后,还在继续用它。
七、边界与没解决的问题
- 十诫是门槛,不是保证。 全部通过也不代表一定正确,只代表"目前没有被推翻"。
- 这套流程源于量化研究实践,迁移到其他领域时,具体检验方法需要重新设计,但思维方式可用。
- "反方复核"依赖复核者的独立性。 如果复核者不独立,这道关卡形同虚设——这是本套方法最脆弱的一环。
- 证据等级是相对的。 中等证据不是"一半可信",而是"目前只支持到这个程度"。
- 未解决的问题:如何在"标准写死"与"允许根据新信息修正"之间取得平衡,目前没有标准答案。本系列的做法是——修正可以,但必须公开记录被替换的原文,不得静默覆盖。
金句墙
- 给你一组历史数据让你找规律,你一定会找到——这不是发现,是筛选的副产品。
- 先有结论、后找理由,不需要你撒谎,只需要你诚实地只往一个方向看。
- 真正的问题不是怎么找到一个好方法,而是怎么最快证明它是错的。
- 违反"未来函数"的检验不产生报错,只产生漂亮的结果。
- 只采访还活着的公司,调查不出创业成功率。
- 想法再好,数据资格不过关就必须停下。
- 墓地不是为了让结论死透,是为了让"重新捡回来"这件事变得有门槛。
- 过几个月你会忘记它为什么死——所以要把死因写下来。
- 这次降级不是体系的失败,而是体系成功的证明。
- 一份研究的价值,很多时候不看它证明了什么,而看它诚实地列出了哪些不成立。
- 一个你解释不了为什么有效的做法,你也就无法知道它在什么情况下会失效。
- 修正可以,但必须公开记录被替换的原文,不得静默覆盖。
行动清单:用这十诫检查你看到的任何"规律"
以下不是投资操作,是思维检查表。它可以用于任何声称"发现了规律"的说法——包括本文。
第一步:先问它的数据从哪来,有没有包含失败者。 只统计活下来的样本,结论必然偏乐观。
第二步:问它用的信息,在当时是不是真的能拿到。 用"事后才知道的事"解释"当时的决定",是最常见的错误。
第三步:问它有没有先写死标准。 只写成功条件、不写失败条件的说法,无法被证伪。
第四步:问它需要多少个前提才成立。 前提越多,越可疑。
第五步:问它有没有被独立复核过。 如果只有提出者自己算出来过,先别信。
第六步:问它列了哪些"不成立"。 一份只报喜不报忧的研究,信息是不完整的。
关于本文的来源
| 项 | 内容 |
|---|---|
| 性质 | 方法论整理 + 作者研究实践的归档记录 |
| 十诫来源 | 作者自建的研究审计规程 |
| 案例来源 | ★ 作者基于公开数据的独立整理(原创),非引用第三方研究成果 |
| 关联 | 本系列第 3 篇《"涨得多的,以后还会涨"》为第 7、8、9 块墓碑的完整过程记录 |
免责声明
本文为原创方法论整理,不构成投资建议、不推荐任何证券、不预测任何市场走势。
本文讨论的检验方法源自特定研究实践,读者在其他场景应用时需自行判断适用性。文中出现的例子仅用于说明方法,不代表对任何标的的评价。
市场有风险,决策请独立判断。