· 量化交易 · 第 6 / 6 讲

一、策略评估指标

Sharpe、Sortino、MDD、Calmar、CVaR、PSR/DSR……用数字衡量策略好坏,建立加密市场可用的标准化评估框架。

评估一个量化策略的好坏,不能只看「总收益率」。两个最终收益相同的策略,可能一个净值平滑上行、另一个剧烈震荡后侥幸翻红——它们承担的风险、统计可靠性和实盘可执行性天差地别。

评估有三个维度:风险调整后的收益(每单位风险换来多少回报)、稳定性(业绩能否持续),以及统计显著性(这是真实优势,还是回测噪声)。

本章结构:① 核心指标(每个完整展开:定义 → 公式 → 假设与失效场景 → 数值示例 → 统计检验)→ ② 进阶/补充指标③ 综合评估框架(加密市场陷阱汇总 + 指标速查表)。Python 计算代码见独立页「指标计算代码库」。


Part I:核心指标

1. Sharpe Ratio(夏普比率)

Sharpe 是最通用的风险调整收益指标,本质是一个信噪比:把策略超额收益(信号)除以其总波动率(噪声)。

定义与公式

定义超额收益序列 αt=rtrfα_t = r_t - r^f,其中 rfr^f 为无风险利率,则单期 Sharpe 为:

SR=E[αt]σ(αt)SR = \frac{\mathbb{E}[\alpha_t]}{\sigma(\alpha_t)}

年化时乘以年化因子 η\eta

SRannual=SRperiod×ηSR_{\text{annual}} = SR_{\text{period}} \times \eta

在 iid(独立同分布,Independent and Identically Distributed)假设下 η=T\eta = \sqrt{T}(T 为年交易周期数):传统金融 T = 252,加密货币 T = 365(全年无休)。

判读标准:SR > 1 可接受,> 2 较优,> 3 优秀。加密市场无风险利率常用 0% 或稳定币理财利率代替。

数值示例:某策略过去 365 天日对数收益率均值 = 0.08%,标准差 = 1.2%。

统计假设、公式修正与失效场景

简单年化公式 SRannual=SRperiod×TSR_{\text{annual}} = SR_{\text{period}} \times \sqrt{T} 成立需要两个前提:① 收益相互独立(无自相关)② 同分布(方差稳定)。这两条在传统金融和加密市场中都普遍不满足。

① 为什么自相关会让年化公式失效

T\sqrt{T} 年化来自统计学基本结论:N 个独立随机变量之和的标准差 = 单期标准差 × N\sqrt{N}。一旦收益之间存在正自相关,相邻期的波动不再独立叠加,而是「同向强化」——连续上涨的 N 天并不是赚了 N 次独立的钱,更像同一笔趋势行情被拆成了 N 天记录。真实有效样本数远小于 N,风险被低估,Sharpe 系统性虚高。

正自相关普遍存在于:动量/趋势策略(Jegadeesh & Titman 1993)、持仓重叠的低频策略、CTA 基金、低流动性资产(私募股权、房地产基金定期估值)——传统金融与加密市场均如此。

Lo(2002)修正:将自相关系数 ρk\rho_k 纳入年化因子分母,使其反映真实的独立信息量:

η=qq+2k=1q1(qk)ρk\eta = \frac{q}{\sqrt{q + 2 \sum_{k=1}^{q-1}(q-k)\rho_k}}

其中 q 为年化周期数,ρk\rho_k 为第 k 阶自相关系数。当 ρk>0\rho_k > 0 时分母变大,η<q\eta < \sqrt{q},修正后 Sharpe 下降。很多「年化 Sharpe 很漂亮」的低频策略,剔除自相关后会显著缩水。

② 肥尾让 Sharpe 低估尾部风险

正态分布认为极端事件(如单日跌 10%)概率极低,几乎不可能发生。但现实收益分布的峰度(kurtosis)普遍大于 3(正态基准值),表现为两个特征:中间更尖(大多数日子收益平平),两端更厚(极端大涨或大跌比正态预测的更频繁)——这就是肥尾

Sharpe 的分母 σ 衡量的是「平均偏差」,对极端值不敏感。肥尾策略的日常波动可能很小(σ 看起来低),但偶尔一次极端暴跌就能将账户打穿。Sharpe 完全感知不到这层风险。

一个具体例子:两个策略年化 Sharpe 同为 1.5——

Sharpe 看起来完全一样,真实风险天差地别。这个差距只有 CVaR 能捕捉到。加密市场肥尾尤为极端,峰度常远超 10,正态假设下「百年一遇」的事件实际上几年就发生一次。

③ 负 Sharpe 的陷阱

策略亏损时 Sharpe 为负,但波动率大的亏损策略 Sharpe 反而「更高」(负数除以更大分母,绝对值更小)。负 Sharpe 只表示在亏,大小无法比较。

④ 对上下行波动一视同仁

Sharpe 把上行波动也算作风险而惩罚,会低估收益右偏(大涨小跌型)的策略——这引出 Sortino Ratio。

统计显著性与置信区间

Sharpe 是从有限样本估计出来的,本身带抽样误差。在 iid 正态近似下,估计量的标准误约为(Lo 2002):

SE(SR^)1+0.5SR^2NSE(\hat{SR}) \approx \sqrt{\frac{1 + 0.5 \hat{SR}^2}{N}}

其中 N 为样本数、SR^\hat{SR} 为单期 Sharpe。

示例:上例 SR^0.0667\hat{SR} \approx 0.0667,N = 365,则 SE(1+0.5×0.06672)/3650.0524SE \approx \sqrt{(1 + 0.5 \times 0.0667^2)/365} \approx 0.0524。单期 Sharpe 的 95% 置信区间约 [0.036, 0.169][-0.036,\ 0.169]——区间跨过 0,说明仅凭一年日线数据,在统计上还无法可靠区别于「无效策略」。样本越短、Sharpe 越低,估计越不可信。

滚动 Sharpe:在时间轴上滚动计算(如 30 日窗口),观察有效性是否稳定;持续走低是策略失效的早期信号。

Probabilistic & Deflated Sharpe Ratio

当你回测了多个参数组合后挑出 Sharpe 最高的那个,「最优 Sharpe」天然被选择偏差抬高了。Bailey & López de Prado 提出两个工具纠偏:

Probabilistic Sharpe Ratio(PSR)——在给定基准 SRSR^* 下,真实 Sharpe 超过该基准的概率,显式纳入偏度 γ3\gamma_3 与峰度 γ4\gamma_4

PSR(SR)=Φ ⁣[(SR^SR)N11γ3SR^+γ414SR^2]PSR(SR^*) = \Phi\!\left[\frac{(\hat{SR} - SR^*)\sqrt{N-1}}{\sqrt{1 - \gamma_3 \hat{SR} + \frac{\gamma_4 - 1}{4}\hat{SR}^2}}\right]

负偏、肥尾(γ4\gamma_4 大)均会拉低 PSR——这正是加密策略需要的修正。

Deflated Sharpe Ratio(DSR):将 PSR 的基准 SRSR^* 替换为「做了 N 次独立试验后,纯靠运气能达到的期望最大 Sharpe」。回测试验次数越多,及格线越高。DSR > 0.95 才算扛得住多重检验。


2. Sortino Ratio(索提诺比率)

定义与公式

Sortino 是 Sharpe 的改进版,只用**下行偏差(Downside Deviation)**作分母,仅惩罚低于目标收益的波动:

Sortino=rˉMARDDSortino = \frac{\bar{r} - MAR}{DD} DD=E[min(rtMAR, 0)2]DD = \sqrt{\mathbb{E}\left[\min(r_t - MAR,\ 0)^2\right]}

其中 MAR(Minimum Acceptable Return)通常取 0 或无风险利率,rˉ\bar{r} 为年化收益率,DD 为下行标准差。

判读标准:Sortino > 1 可接受,> 2 较优。对同一策略 Sortino 通常高于 Sharpe(分母更小),比较时需在同类指标间进行。

数值示例:某策略年化收益率 18%,MAR = 0%,过去 365 天中共有 160 天收益为负,这 160 天的平方均值开根号得 DD = 1.8%/天,年化 DD = 1.8% × √365 ≈ 34.4%。

统计假设与失效场景

① 下行样本更少,估计噪声更大。 Sharpe 用全部 N 个样本估计,而 Sortino 的分母只用 rt<MARr_t < MAR 的那部分。若负收益天数仅占 30%,有效样本数缩减到 ~0.3N,标准误显著放大。短样本(< 1 年)的 Sortino 可信度不如 Sharpe。

② 对趋势跟踪策略更公平。 趋势策略典型特征是「多数小亏 + 少数大赚」——上行波动大,但这是好事。Sharpe 把大赚的波动也算作风险而惩罚,Sortino 不会,因此对这类策略的评估比 Sharpe 更准确。

③ MAR 的选取影响可比性。 不同策略若使用不同 MAR,Sortino 不可直接比较。横向比较时需统一 MAR = 0 或同一无风险利率。

④ 加密市场的肥左尾。 加密收益分布左尾极厚,极端暴跌日的下行平方项会主导 DD 计算,导致 Sortino 对尾部风险的感知反而比 Sharpe 更敏感——这是优点,但也意味着极端行情样本的多寡会使结果波动较大。

与 Sharpe 的对比

维度SharpeSortino
风险度量全波动(上+下)仅下行波动
适用策略通用收益不对称(趋势、期权买方)
样本利用率100%~30–50%(仅负收益期)
估计稳定性较稳短样本噪声大
通常数值关系较低较高(分母更小)

3. 最大回撤与回撤族指标

3.1 最大回撤(Max Drawdown, MDD)

定义与公式

MDD 衡量策略在历史最坏情况下从峰值到谷底的最大亏损幅度,直接决定实盘的心理底线与可用杠杆。

MDD=maxt1<t2V(t1)V(t2)V(t1)MDD = \max_{t_1 < t_2} \frac{V(t_1) - V(t_2)}{V(t_1)}

其中 V(t)V(t) 为 t 时刻净值。需遍历所有历史高点 t1t_1 及其后低点 t2t_2,取最大跌幅。

数值示例:净值序列 1.0 → 1.3 → 1.1 → 1.5 → 0.9 → 1.2

回撤的两个维度

幅度只是一半,另一半是时间

统计假设与失效场景

① MDD 随样本长度单调不减。 MDD 是路径依赖指标,看得越久越可能撞上更大的回撤。在随机游走近似下,期望最大回撤大致以 σT\sigma\sqrt{T} 增长。直接后果:不同回测长度的 MDD 不能直接比较,比较前必须统一时间窗口。

② 加密波动率放大 MDD。 加密资产 σ 远高于传统资产(BTC 日波动率常达 2–5%,传统股票约 1%),相同时间窗口下 MDD 天然更大,横向与股票策略比较会失真。

③ MDD 不捕捉频率。 一次大回撤和十次小回撤的 MDD 可能相同,但对策略稳定性的判断完全不同。需配合 Ulcer Index 使用。

3.2 Calmar Ratio(卡玛比率)

定义与公式

Calmar=年化收益率MDDCalmar = \frac{\text{年化收益率}}{|MDD|}

衡量「每单位最大回撤风险换来多少年化收益」,是回撤控制要求严格的策略(CTA、趋势跟踪)的核心指标。

判读标准:> 1 合格,> 3 优秀。

数值示例:年化收益率 24%,MDD = 18%,则 Calmar = 24% / 18% = 1.33(合格)。

统计假设与失效场景

① Calmar 通常定义在最近 36 个月。 不同窗口算出的 Calmar 不可比,比较时必须统一时间窗口(业界惯例 36 个月)。

② 分子与分母的时间窗口要一致。 若分子用全样本收益、分母用近 1 年 MDD,结果会被系统性高估。

③ 一次极端事件即可大幅压低 Calmar。 Calmar 对尾部事件非常敏感,单看某时点的快照有局限,应看其随时间的变化趋势。

3.3 Ulcer Index 与 Martin Ratio

定义与公式

Ulcer Index(UI)同时惩罚回撤的深度和持续时间,比只看单点 MDD 更能反映「煎熬程度」:

UI=1Nt=1NDt2UI = \sqrt{\frac{1}{N}\sum_{t=1}^{N} D_t^2}

其中 DtD_t 为 t 时刻相对历史最高净值的回撤百分比(始终为非负)。

Martin Ratio

Martin=年化超额收益UIMartin = \frac{\text{年化超额收益}}{UI}

数值示例:某策略连续 10 天回撤分别为 2%, 3%, 5%, 8%, 10%, 8%, 5%, 3%, 2%, 0%。

这比 MDD = 10% 更平滑地反映了「持续处于水下」的压力。

与 MDD / Calmar 的对比

维度MDDCalmarUlcer IndexMartin Ratio
捕捉什么单次最大跌幅回撤效率(点)深度 × 持续时间回撤效率(面积)
对频繁小回撤不敏感不敏感敏感敏感
对单次极端回撤非常敏感非常敏感较敏感较敏感
适用场景通用风险底线CTA / 趋势策略网格 / 做市 / 长持同左

4. 期望值、几何收益与 Kelly

4.1 期望值(Expected Value)

E=W×AvgWin(1W)×AvgLossE = W \times AvgWin - (1-W) \times AvgLoss

只有 E > 0 才具备数学正期望。

数值示例(设平均亏损 = 1):

策略胜率 W盈亏比E结论
A70%0.50.7×0.5 − 0.3×1 = +0.05正期望 ✓
B80%0.20.8×0.2 − 0.2×1 = −0.04负期望 ✗

B 胜率更高却长期必亏——高胜率 ≠ 好策略

4.2 几何收益与波动拖累(Volatility Drag)

gμσ22g \approx \mu - \frac{\sigma^2}{2}

σ2/2\sigma^2/2 即「波动拖累」。即使算术期望 μ > 0,只要波动 σ 足够大,几何收益 g 仍可能为负,长期净值持续缩水。

数值示例:月度 μ = 5%,σ = 20%。

4.3 Kelly Criterion(凯利公式)入口

f=WL1WGf^* = \frac{W}{L} - \frac{1-W}{G}

或在连续收益下等价为 f=μ/σ2f^* = \mu / \sigma^2Full Kelly 波动极大,实践中常用 Half-Kelly 或更低仓位。 详见「三、风险管理基础」。


5. Information Ratio(信息比率)

定义与公式

IR=E[rtbt]σ(rtbt)IR = \frac{\mathbb{E}[r_t - b_t]}{\sigma(r_t - b_t)}

其中 btb_t 为基准收益(加密市场常用 BTC Buy-and-Hold 或等权市值加权指数)。IR 衡量策略相对基准的主动 alpha 的稳定性

判读标准:IR > 0.5 可接受,> 1.0 优秀。

统计假设与失效场景

① 基准选取直接影响 IR 数值。 评估主动策略时,基准应是「不做任何主动操作时的自然选择」——对于全仓加密的策略通常是 BTC HODL 或市值加权指数。

② IR 和 Sharpe 的关系。 若基准 bt=rfb_t = r^f(无风险利率),IR 退化为 Sharpe。当基准本身波动很大(如 BTC),IR 通常低于同策略的 Sharpe。

③ 加密市场 alpha 的衰减。 IR 在时间轴上的稳定性(滚动 IR 是否持续为正)比单点数值更有意义。


6. CVaR / Expected Shortfall(条件在险价值)

CVaR 与 Sharpe、MDD 并列,是加密量化策略风险评估不可缺少的核心工具,专门捕捉 Sharpe 和 MDD 都看不到的极端尾部损失。

先理解 VaR

把策略所有交易日的收益排列,VaR₉₅ 回答:最差的 5% 的日子里,亏损的门槛是多少?

比如 VaR₉₅ = -3%,意味着有 95% 的日子亏损不超过 3%,有 5% 的日子亏损超过 3%。

VaR 的问题:只告诉你「超过了这条线」,超过之后亏多少它不管。同样是 VaR₉₅ = -3%,两个策略的最差 5% 可能天差地别:

定义与公式

CVaR 补上这个缺口,回答:在最差的那 5% 的日子里,平均亏多少?

CVaRα=E[rtrtVaRα]CVaR_{\alpha} = \mathbb{E}\left[r_t \mid r_t \leq VaR_{\alpha}\right]

即在收益低于 VaR 阈值的条件下,收益的期望值。

数值示例:365 天中最差 18 天(约 5%)的平均收益为 -3.2%。

为什么是核心指标而非补充指标

加密收益峰度极高,暴跌日损失远超正态假设——交易所暴雷、协议被黑、监管打压,这类事件发生时亏损可能是 -30% 甚至归零。CVaR 直接对尾部均值建模,是黑天鹅风险的直接量化工具。

Sharpe + MDD + CVaR 三件套是加密策略风险评估的最小完备集,三者分别捕捉不同层次的风险:

判读标准:CVaR 无固定及格线,关键看横向对比。同类策略中 CVaR 越接近 0 越好;若 CVaR 远大于 MDD 日均值,说明尾部存在超预期的极端事件。


Part II:进阶与补充指标

7. Omega Ratio

给定阈值 θ:

Ω(θ)=E[max(rtθ, 0)]E[max(θrt, 0)]\Omega(\theta) = \frac{\mathbb{E}[\max(r_t - \theta,\ 0)]}{\mathbb{E}[\max(\theta - r_t,\ 0)]}

Omega 用到整个收益分布(含所有高阶矩),不假设正态,对肥尾分布尤其合适。θ = 0 时,Ω > 1 等价于正期望,但比期望值更丰富——它反映收益分布的整体形态。

数值示例:θ = 0%,正收益天加总 = 15%,负收益天亏损加总 = 10%,则 Ω = 1.5(盈面占优)。


8. Tail Ratio

Tail Ratio=P95P5Tail\ Ratio = \frac{|P_{95}|}{|P_{5}|}

右尾(盈利极值)与左尾(亏损极值)的比值。> 1 表示右尾更肥,对趋势策略是好信号;< 1 则相反(典型的卖期权或做市策略形态)。

数值示例:95 分位日收益 = +4.2%,5 分位 = -2.8%,Tail Ratio = 1.5(右尾占优)。


9. Gain-to-Pain Ratio

GPR=月度正收益月度负收益GPR = \frac{\sum \text{月度正收益}}{|\sum \text{月度负收益}|}

Schwager 常用指标,直观且对异常值稳健。GPR > 1 即盈利总量超过亏损总量。不依赖正态假设,以「累计盈亏」而非「均值/方差」评估,对月度频率的策略总结很直观。


Part III:综合评估框架

加密市场特有的评估陷阱(汇总)

指标组合框架

任何单一指标都有盲区,实践中应组合使用,并始终追问「这个结果在统计上可靠吗」:

  1. Sharpe / Sortino(+ PSR / 置信区间)—— 风险调整收益及其显著性
  2. MDD + 回撤持续时间 / Ulcer Index(+ Martin Ratio)—— 极端风险与煎熬程度
  3. Calmar(统一 36 个月窗口)—— 回撤效率快照
  4. 期望值 + 几何收益 g(+ Kelly f*)—— 每笔交易数学期望与复利后真实增长
  5. CVaR(+ Tail Ratio)—— 尾部极端损失
  6. Information Ratio(滚动)—— 相对基准的持续 alpha
  7. 净值曲线平滑度 + 扣费后业绩 —— 直观稳定性与实盘可执行性

任何一项明显不及格,或样本长度过短、PSR 偏低,都应对策略保持警惕,而非被某个亮眼的单一指标迷惑。

指标选用场景速查表

场景推荐指标注意事项
横向对比多个策略Sharpe(+ PSR 检验显著性)统一年化口径、Lo 修正自相关
评估极端损失风险CVaR + MDD + 回撤持续时间加密必看 CVaR
回撤控制严格(CTA / 趋势)Calmar + Ulcer Index + Martin统一 36 个月窗口
收益分布不对称 / 肥尾Sortino + Omega + Tail Ratio注意 Sortino 样本量不足问题
对比被动持仓(BTC HODL)Information Ratio统一基准定义
防止参数过拟合 / 多重检验DSR(> 0.95)+ PSR记录总试验次数
每笔交易质量期望值 E + 几何收益 g勿被高胜率迷惑
综合快速筛选Sharpe + MDD + 期望值三件套三者均过关再深入