统计学基础:量化的"底层操作系统"
你有没有想过,为什么隔壁老王炒了十年股还是亏,而有些量化团队却能稳定盈利?差距不在运气,在于他们用统计学"看"市场的方式和你不一样。这篇文章就是带你装上这副眼镜。
这是什么
统计学是从数据中提取规律的学问。在 量化 交易里,它就是你的底层操作系统——你不一定天天算公式,但你做的每一个判断(这个策略能不能用、这个信号靠谱不靠谱、这笔亏了是不是该止损),背后全是统计学。
我们要讲的核心概念:概率、期望值、分布、方差、相关性、假设检验、大数定律。听起来吓人,但其实你日常生活中一直在用,只是没意识到。
为什么它重要
- 帮你区分"运气"和"能力"——连赚五笔到底是水平好,还是纯粹蒙的?统计学给你答案
- 帮你量化风险——"这只股票波动大"是废话,"标准差 3.2%"才是能用来决策的信息
- 帮你判断策略有效性——回测赚了 50%,是真的有效还是过拟合?不做统计检验就是在赌
- 帮你管理预期——知道亏损是"正常波动"还是"策略失效",心态完全不一样
概率基础:一切从"不确定性"开始
什么是概率
概率就是某个事件发生的可能性大小,用 0 到 1 之间的数表示。0 代表绝对不可能,1 代表一定发生。
打个比方:你掷一颗骰子,出现 6 的概率是 ,大约 16.7%。这不是什么高深的东西,但你仔细想想——A 股明天涨跌,本质上也是一个概率事件。
条件概率
条件概率就是"在已知某件事发生的前提下,另一件事的概率"。记作 ,读作"在 B 发生的条件下 A 发生的概率"。
生活场景:你朋友小郑平时迟到概率 30%。但如果当天下雨,他迟到概率飙升到 80%。这就是条件概率——。
A 股场景:股票涨停的概率平时可能只有 3%,但如果整个 板块集体拉升、成交量放大三倍,那涨停的概率就高得多。条件概率告诉我们:不要孤立地看概率,要结合当前环境。
独立事件
两个事件互不影响,就叫独立事件。掷两次骰子,第一次的结果不影响第二次。
但 A 股里,绝大多数事件都不是独立的。昨天涨停的股票,今天的走势和昨天的涨停是有关系的。主力资金今天大举买入,明天的 价格走势也受影响。忽视这种关联性,是新手常犯的错。
期望值:量化最核心的一个概念
这是什么
期望值(Expected Value)就是所有可能结果的概率加权平均。公式是:
翻译成人话:把每种结果乘以它发生的概率,再加起来。
生活场景
老吴开小卖部卖西瓜。好瓜概率 80%,每个赚 5 块;坏瓜概率 20%,每个亏 10 块(客户退货+口碑损失)。每个西瓜的期望利润:
所以长期看,每卖一个西瓜,老吴平均赚 2 块。虽然单个可能赚可能亏,但卖得够多,利润就趋近于 2 元/个。
A 股场景
这才是重点。你的交易系统本质上就是一个期望值游戏:
每笔交易期望赚 1%。注意:你不可能每笔都赚 1%,但做 100 笔之后,平均下来就接近这个数。
这里引出另一个关键概念——盈亏比。盈亏比 = 平均每笔盈利 / 平均每笔亏损。上面例子的盈亏比是 3%:2% = 1.5:1。
一个反直觉的结论:胜率不到 50% 也能赚钱。只要盈亏比够高(比如胜率 40% 但盈亏比 3:1,期望值仍然是正的)。很多 散户 追求高胜率,却忽视盈亏比,这就是亏钱的根源之一。
分布:数据的"形状"
正态分布
正态分布就是那个著名的"钟形曲线"——中间多、两边少、对称。大部分数据集中在均值附近,越远离均值越少。
人的身高、考试成绩,大致服从正态分布。
厚尾分布
但股价收益率不是正态分布!它有"厚尾"——极端事件(暴涨暴跌)发生的概率,比正态分布预测的要高得多。
生活比喻:如果说正态分布是"普通一天的气温变化"(大多数时候差不多),那厚尾分布就是"偶尔来个台风"——极端天气比你以为的频繁得多。
A 股场景:2015 年股灾、2020 年疫情开盘暴跌、某些 K 线 上的天地板……按照正态分布,这些事件几万年才该出现一次,但在 A 股几乎每隔几年就来一次。这就是厚尾。
DANGER
如果你的风控模型假设股价服从正态分布,那你在黑天鹅面前的防护就像纸糊的。2015 年多少量化基金死在低估极端行情的概率上?数都数不过来。
方差与标准差:衡量"有多乱"
这是什么
方差(Variance)和标准差(Standard Deviation)衡量的是数据的离散程度——数据离平均值有多远。
标准差 是方差的平方根,单位和原始数据一样,更好理解:
生活场景:两个快递员,都平均 30 分钟送到。但小郑每次都在 28-32 分钟之间,老吴有时 10 分钟有时 50 分钟。两人均值一样,但老吴的方差大得多。你更信任谁按时送到?
A 股场景
标准差 = 波动的量化指标。一只股票日均涨跌幅 2%,标准差 0.5%,说明走势比较稳;另一只也是日均 2%,标准差 3%,说明上蹿下跳。
标准差直接关联 风险 和 回撤。高标股标准差大,赚起来爽,亏起来也狠。你的 止盈止损 幅度,应该参考标的的标准差来设定,而不是拍脑袋。
相关性:谁跟谁"同步"
这是什么
相关性(Correlation)衡量两个变量之间的线性关系,取值在 -1 到 1 之间。
- 正相关(接近 1):A 涨 B 也涨,步调一致
- 负相关(接近 -1):A 涨 B 跌,跷跷板
- 不相关(接近 0):各走各的,互不影响
A 股场景
- 同一板块的股票通常高度正相关。比亚迪涨停,宁德时代大概率也涨——这就是板块联动
- 均线 和 MACD 等技术指标之间的相关性其实很高,叠了五六个指标可能等于只看了一个
- 分散投资的核心:找相关性低的品种组合在一起,整体波动(风险)就会降低。如果你买的五只股票全是同一板块的,"分散"了个寂寞
TIP
构建投资组合时,优先选择相关性低的品种。比如消费 + 科技 + 医药,比"五只新能源"的抗风险能力强得多。用相关系数矩阵检查你的持仓,相关性超过 0.7 的基本没起到分散效果。
假设检验与置信区间:策略真的有效吗?
这是什么
假设检验就是用数据来判断一个结论是否站得住脚。置信区间则是"真实值大概落在这个范围内"。
生活场景
小郑说他投篮命中率 60%。你让他投了 10 个,进了 4 个。你能说他吹牛吗?不一定——样本太小,可能是运气差。但如果投了 1000 个,命中率只有 40%,那你就有信心说他确实没 60%。
A 股场景
你回测了一个策略,过去两年年化收益 30%。问题是:这到底是策略有效,还是纯粹碰巧赶上了好行情?
假设检验的思路是:先假设"策略无效"(零假设),然后看数据是否足够强来推翻它。如果回测结果的 P 值小于 0.05(即如果策略真的无效,出现这种收益的概率不到 5%),我们才有信心说"策略可能真的有效"。
置信区间则是给出一个范围。比如"这个策略的真实年化收益有 95% 的概率在 15%-45% 之间"。注意这个区间可能包含 0,那就说明策略未必真的赚钱。
WARNING
很多散户看到一个策略回测赚了钱就马上实盘,根本不做统计检验。回测赚 30% 可能只是两年里行情好,换个时间段可能就亏。不做假设检验就上实盘,跟闭眼开车没区别。
大数定律与中心极限定理:为什么"做得多"才靠谱
大数定律
样本量越大,样本均值越接近真实期望值。
回到老吴卖西瓜的例子:卖 10 个西瓜,可能全碰上好瓜,利润远高于 2 元/个;也可能运气差,反而亏钱。但卖 10000 个西瓜,平均利润几乎一定接近 2 元/个。
A 股场景:你的策略期望值是每笔 +1%。做 5 笔,可能全亏(完全可能,概率不算低)。做 500 笔,结果就非常接近每笔 +1% 了。这就是为什么交易频次够高对量化策略很重要——样本量不够,你根本看不出来策略到底行不行。
中心极限定理
不管原始数据是什么分布,样本量足够大时,样本均值的分布趋近于正态分布。
这意味着:即使股价收益率是厚尾分布,你算出来的"平均收益率",在样本够多时,也能用正态分布的套路来分析。这给了我们做置信区间和假设检验的理论基础。
新手容易亏在哪
- 被短期结果骗了:做了 3 笔赚了 2 笔就觉得策略无敌——3 笔的样本啥也说明不了,大数定律告诉你样本量要够大
- 忽视期望值只看胜率:胜率 80% 但每次赚 1% 亏 8%,期望值是负的,长期必亏
- 以为股价服从正态分布:低估了极端行情的频率,止损设得太窄,一波黑天鹅直接打穿
- 相关性叠加:买了十只"不同"的股票,结果全是一个板块的,暴跌时一起死
- 不做统计检验就信回测:回测好看 ≠ 策略有效,可能只是过拟合或者运气
新手最容易踩的坑
DANGER
把相关性当因果性。你发现某指标和股价涨跌高度相关,就以为"这个指标能预测涨跌"。错!相关不等于因果。可能是第三个因素同时影响了两者,也可能纯粹巧合。A 股里虚假相关的例子一抓一大把——"某年世界杯期间 A 股必跌"就是典型的伪相关。
WARNING
样本量不足就下结论。回测 20 笔交易就敢说"年化 100%"?醒醒。20 笔的随机波动可以产生任何结果。量化策略至少需要几百笔交易的数据才能初步判断有效性。
WARNING
生存者偏差。你看到的都是赚钱的人在晒单,亏钱的人早沉默了。这让你高估了市场的"可赢性"。某个策略被 1000 个人试过,总有几个人连续赚钱——但他们只是运气好的幸存者,不是策略真的有效。
实战里怎么用
TIP
先算期望值再开仓。每笔交易前问自己:我的胜率是多少?盈利空间多少?止损多少?期望值是正的吗?期望值为负的交易,一笔都不该做。
TIP
用标准差设止损。如果你持有的股票日均波动 1.5%,止损设在 -1% 就太近了,正常波动就会扫掉你。至少给 2 倍标准差的空间。
TIP
用相关性做分散。持仓里每只股票两两之间的相关系数最好不超过 0.5。免费工具很多,随便一搜就有,花 10 分钟查一下,可能救你一命。
操作前先想清楚
WARNING
统计学是工具,不是水晶球。它能帮你提高判断的准确率,但不能保证你每次都对。再好的统计模型也有失效的时候,尤其是在市场结构发生变化(比如政策突变、新规则出台)的时候。永远留好安全边际。
总结
统计学是量化交易的"底层操作系统"。这篇文章你只需要记住几件事:
- 概率告诉你每件事发生的可能性,别用"感觉"代替数字
- 期望值是量化最核心的概念——,期望值为正才值得做
- 股价不是正态分布,极端行情比你以为的频繁得多,风控要留足余量
- 标准差量化波动,止损止盈参考它来设
- 相关性决定分散效果,别买一筐同板块还以为分散了
- 假设检验帮你判断策略是真好还是碰巧,回测好看不等于能赚钱
- 样本量要够大,10 笔 20 笔的交易结果说明不了任何问题
本章新学到:概率、条件概率、期望值()、正态分布与厚尾分布、方差与标准差、相关性系数、假设检验与 P 值、大数定律、中心极限定理。这些概念构成了量化交易分析的基础框架。
股市有风险,入市需谨慎。本文不构成任何投资建议。