量化与 AI 投研概念库

回测/止损/滑点/因子…随查随用的「它到底在说什么」

前视偏差:回测年化 80%,实盘第一个月就亏,问题常出在这

前视偏差是量化系统里最会骗人的一类错误——它不报错、不崩溃,只是安静地让你的历史成绩变好看。这篇讲清它怎么发生、为什么极难自查,以及不同系统各自用什么办法对付它

回测到底在算什么:它替你重放了历史,也替你做了一堆假设

回测报告上那几十个数字是怎么来的?这篇拆开程序内部的那层循环,讲清它按什么价成交、扣什么费、遇到说不清的地方按什么规矩填,以及三个你没同意过却一直生效的默认假设

样本内与样本外:那份没见过的数据,你只有一次机会

为什么必须把历史切成两段——一段找规律、一段验规律。重点讲「样本外只能用一次」这条反直觉的纪律,以及你反复调参时,它是怎么在你毫无察觉的情况下悄悄失效的

滚动前进验证:别只考一次试,让它每年都重考一遍

把历史一刀切成「前面训练、后面验证」,只考了一次试;滚动前进是把这场考试重复十几次。这篇讲窗口怎么排、滑动和扩张各自在假设什么,以及为什么同一个词在不同系统里指的不是同一件事

Point-In-Time 数据:一个数字「什么时候才被人知道」,比它是多少更重要

财报的报告期和公布日差着一两个月,同一期数据还会被反复修订。这篇讲清「时点数据」在解决什么问题、qlib 的 PIT 文件为什么要为每个数字多存三列,以及不写代码的人该怎么用这个概念挑数据

指标的启动期:同一根 K 线,为什么回测和实盘算出的数不一样

EMA 这类带记忆的指标,值取决于往前喂了多少根 K 线。回测喂得多、实盘喂得少,同一时刻算出的就不是同一个数——这篇讲清它怎么发生、怎么量、该喂多少才够

幸存者偏差:你的股票池里,输掉的那些早就不见了

历史数据里只剩下活到今天的公司,退市的、被吃掉的、换了芯的都不在名单上——这篇讲清它在 A 股的具体形态,以及不动代码也能做的六项自查

过拟合:调参这个动作本身,就是一台噪音制造机

别人讲过拟合是「参数太多」,这篇只讲一件事——参数寻优的过程如何自动生产过拟合,以及跑完之后你能用哪几种统计手段把它从结果里读出来

参数高原与参数尖峰:为什么「最好的那个参数」常常是最不能用的

一个回测出来的最优参数值不值得信,不看它自己,看它旁边那几格长什么样。这篇讲清高原与尖峰的差别、尖峰是怎么被搜索过程亲手制造出来的,以及量化系统各自用什么办法不让你掉进针尖里

蒙特卡洛检验:把交易顺序打乱一千次,看你的成绩还剩多少

同一批交易换个先后顺序,总盈亏一分不差,资金曲线却能从「稳步向上」变成「差点归零」。这篇讲清打乱重排到底在检验什么、p 值是怎么数出来的,以及它治不了哪种病

数据窥探:同一段历史被你试了一百遍,它迟早会给你一个好看的答案

反复在同一份历史数据上试探,为什么会系统性地制造出「好看但无效」的规律;试过多少次这个分母为什么根本数不清;以及不同系统各用什么办法给「试了多少遍」定价

基准与超额收益:不写清跟谁比的收益率,等于没说

讲清基准该怎么选、超额收益的几种算法各自在回避什么问题,以及为什么牛市里几乎所有人都会高估自己的水平

回测里的交易成本假设:改一个小数点,一半策略当场死掉

回测用哪一档费率、算不算滑点、算不算自己把价格买高——这三个假设几乎决定了一条资金曲线是真是假。这篇讲清成本假设藏在哪、为什么高频策略最先死、以及三套系统各自怎么建模

回测偏差地图:好看的历史成绩,是在哪一道工序上做出来的

前视、幸存者、启动期、成交、成本、过拟合、数据窥探——这几种偏差不是并列的名词,它们各自卡在回测流水线的不同工序上。这篇把它们排回原位,讲清为什么单独修好一种没用

滑点:你按这个价下单,真成交时价格已经跑掉了

滑点不写在手续费清单上,却每一笔都在收。这篇讲清它从买卖价差、单子排队和延迟三处怎么来,什么时候会突然放大,以及回测为什么系统性地低估它

止损:从心理问题变成数学问题

你设的那个止损价,在系统里其实是三样东西——一个不断被重算的价格、一条判定「碰到了」的规则、一笔真去市场上成交的订单。这篇讲它们各自会在哪里跑偏

止盈:为什么它比止损难,因为你要亲手砍掉自己赚得最多的那一笔

止盈和「让利润奔跑」天生打架。这篇拆开固定止盈、分批止盈、按波动率止盈各自在放弃什么,以及为什么止盈的回测数字比止损更容易骗人

追踪止损:止损线跟着价格往上爬,代价是你会被反复扫出去

追踪止损想同时办成两件互相打架的事——别过早离场、也别把赚到的利润还回去。这篇讲清它「只上不下」的机制、在震荡行情里被反复扫掉的代价,以及为什么它的回测成绩格外不可信

手续费与印花税:为什么手一勤,赚的全被这几笔小钱吃光

一次 A 股买卖到底要掏几笔钱、哪一笔只在卖出时收,以及「单次成本 × 年交易次数」这个乘法为什么能把一条向上的曲线压平

冲击成本:你这笔单子自己把价格买高了

同一套方法,管十万块和管十个亿是两件事。这篇讲清「自己推走价格」这笔看不见的钱按什么规律收、为什么回测系统几乎都把它当成零,以及它怎么变成策略容量的天花板

限价单与市价单:一个保价格,一个保成交,你只能挑一个

市价单必成交但价格随缘,限价单价格听你的但可能一直挂着不成交。这篇讲清这个取舍在哪些场景下会翻车,以及真实系统为什么要按「动作」分别配置订单类型

流动性与策略容量:钱一多,同一套方法就不好使了

一套规则在小钱上跑得好、加到大钱上就失灵,这不是运气问题而是容量问题。这篇讲清容量上限从哪来、为什么成本涨得比规模快,以及一套被公开的好方法为什么会自己走向失效

回测里的成交假设:你以为你买到了,那天可能根本没人卖给你

回测默认「你想成交就能成交」,可涨停板买不到、跌停板卖不掉、停牌期连报价都没有。这篇把常见的几种撮合假设按乐观程度排成一把尺子,帮你看出手里那份回测报告站在哪一格

调仓频率:多久换一次仓,这个旋钮比你想的贵得多

调仓频率不是习惯问题,它同时压着交易成本、策略能装多少钱、信号还新不新鲜这三件事,往哪边拧都要还债——这篇讲清三方权衡怎么发生,以及为什么它不能交给优化器去选

卡玛比率:把「你能不能扛住」压成一个数

卡玛比率的分母不是波动率而是最大回撤,所以它比夏普更贴近持有体验;也正因为分母是历史上的单点极值,它对样本和采样粒度敏感得多——这篇讲清它到底在衡量什么、什么时候会骗你

最大回撤:从数字到体感

最大回撤是量化报告里最容易被扫一眼就过的数字,可它其实是整份报告里最难懂的一个——它怎么被算出来、为什么比波动率更贴近你的真实痛感,以及它那个几乎无解的缺陷

回撤恢复期:亏完之后,你还要在水下待多久

最大回撤告诉你坑有多深,恢复期告诉你要在坑里待多久——后者才是真正让人放弃的那个数,而主流回测报告默认根本不算它

下行风险:只惩罚往下的波动,可「往下」到底从哪算起

下行波动听起来天经地义,但「多低才算下行」「除以几个数」「哪些样本算数」三个问题各有各的答案——同一段净值,换个口径算出来的下行风险能差出好几倍

beta 与 alpha:跟大盘的部分,和不跟的部分

把收益拆成「市场推的」和「自己挣的」两块听着简单,难的是那条分界线本身要靠估——而 beta 只要估偏一点点,凭空多出来的部分就会被记在 alpha 头上

相关性:你以为的五个仓位,可能只是一个半

相关性到底怎么算出来、为什么在危机那天集体飙到 1、以及为什么静态的一个数字靠不住而滚动的一条曲线才有用

风险平价:你以为的「平均分」,其实一点都不平均

每个标的投一样多钱,账户的脾气却被其中一个说了算——这篇讲清「按风险分配」的直觉、它悄悄假设了什么、以及它在什么情况下会反过来咬你一口

怎么看一条收益曲线:别只看终点,看它的形状

一条一路向上的资金曲线能藏下多少问题?这篇讲你该按什么顺序看它——先问纵轴是什么,再看斜率、回撤形状、收益的日期分布,最后看那些不该出现的台阶

业绩归因:赚的钱到底从哪来

账户涨了 25%,你以为是自己选股准,其实可能只是你重仓的那个行业整体涨了。这篇讲清怎么把收益拆成配置、选股、成本和运气四份,以及为什么不拆你就没法判断自己能不能重复

尾部风险:VaR 说「95% 的日子最多亏 2%」,剩下那 5% 呢

VaR 是量化风控里最常见的一个数字,也是最容易被误读的一个——它给的是一道门槛的高度,不是门后深渊的深度。这篇讲清它到底在回答什么问题、为什么它在 2008 年集体失灵,以及真实系统为什么从不让它单独出现

因子:把「为什么涨」变成一个可以算出来的数

「这票业绩好」「那票太贵了」——这类说法电脑听不懂。因子就是把这些说法压成一个能给每只股票算出具体数值的规则,这篇讲清它和指标的区别、什么样的因子才算有效,以及这个词为什么在学术界和实战里指的不是同一件事

公式化因子:一句表达式就是一个因子,代价是你能写出几万个

量化系统为什么要专门发明一套写因子的表达式语言,它把「试一个想法」的成本降到了多低,又因此放大了哪一类风险

IC 与 IR:怎么判断一个因子有没有用

因子和未来收益的相关性常常只有百分之几,为什么还被当成「有效」?这篇讲清 IC 为什么必须按天算、IR 衡量的到底是什么,以及稳定的弱信号凭什么比不稳定的强信号值钱

多因子合成:几个弱信号怎么变成一个强信号

等权、IC 加权、回归三种合成方式各自在赌什么,以及为什么因子之间相关性一高,你辛辛苦苦合成的那个数其实还是原来那一个

动量因子:追涨为什么有时候是对的

「涨得好的继续涨」听着像韭菜宣言,却是被反复验证的市场现象。这篇讲清动量在解决什么问题、为什么它对时间尺度极度敏感(同一段价格换个窗口就给出相反结论),以及它在 A 股会撞上哪几堵墙

价值因子:便宜到底怎么定义

市盈率、市净率这些「便宜」的尺子,各自量的是不同的东西,也各自在不同的地方失灵。这篇讲清每把尺子的分母藏着什么假设,以及价值因子跑输那些年,究竟是尺子坏了还是世界变了

信号衰减:好因子为什么会慢慢失效,公开的那些为什么基本没用了

一个规律被发现、被使用、被套利掉,是有生命周期的。这篇讲清衰减到底怎么发生、怎么和「本来就没用」区分开、系统里靠哪些量去监测,以及这件事为什么把整个行业逼成了一场军备竞赛

因子拥挤:大家都用同一个信号,平时没事,出事就是一起出

同一个信号上挤满了钱,日常看起来风平浪静,可一旦有人先跑,出口就堵死了。这篇讲清拥挤是怎么攒出来的、它有哪些可观察的迹象,以及它和流动性到底是什么关系

中性化:把不想要的暴露剔掉,剩下的才是你的本事

一个「选股因子」跑得好,有可能它只是替你押中了某个行业或某种规模的股票。中性化就是把这些搭便车的成分先扣掉,再看你手里还剩什么——这篇讲清它怎么做、扣掉的是什么、以及为什么扣得太干净反而危险

特征与标签:机器学习在投资里到底学什么

大家都在说「用 AI 选股」,可模型到底在学哪道题?这篇讲清标签怎么定义决定了整件事的性质——预测涨跌、预测收益率、预测排序,是三种难度完全不同的活

时序交叉验证:随机切一刀,模型就已经看过答案了

通用机器学习那套「随机划分训练集和测试集」,搬到金融数据上等于让模型左右夹击猜中间。这篇讲清为什么必须按时间切、为什么按时间切了还得再留一段空隙,以及那段空隙该由什么决定

正则化与泛化:给模型装一副刹车,让它别把噪音当规律

模型在训练数据上越准,在没见过的数据上往往越不准。这篇讲清正则化这副「刹车」到底怎么工作、几种常见踩法各自的直觉,以及为什么金融数据要求你把刹车踩得比别的行业重得多

模型吐出一列分数之后呢:从打分到持仓,中间还有一整套决定

教程讲完因子和模型就收尾了,可分数本身买不了任何东西——这篇讲清从一列分数到「买什么、买多少、什么时候换」中间要做的决定,以及为什么这一段常常把超额收益吃干净

模型会过期:找到一个好模型,其实才刚开始

一个在历史上表现很好的模型,上线之后会慢慢变钝。这篇讲清它为什么会衰减、真实系统靠哪几个动作让它一直保持新鲜,以及「多久重训一次」这个问题本身为什么没有标准答案

让大模型直接做交易决策,这条路现在走到哪了

大模型写出来的投资分析读着比你自己想的清楚,但它和传统量化根本不是一回事——一个在做语言推理,一个在做统计验证。这篇讲清两者的本质差别、开源项目实际是怎么搭的,以及这条路目前卡在哪几处

AI 说得有鼻子有眼,可那个数字是编的:哪些必须人工回查

大模型给出的数字长得和真数据一模一样,却可能压根不存在。这篇讲清 AI 幻觉在投研场景里的四种典型形态、各自的识别信号,以及一份能直接照着用的核验清单

本站内容仅为投资教育,不构成投资建议;不荐标的、不预测点位、不承诺收益。投资有风险,决策需谨慎。