← 返回教程库

散户做量化,真实门槛在哪几道

最后更新 2026-08-19
📚 量化与 AI 投研 📖 量化认知与边界 ⏱ 约 21 分钟 R2 · 注意风险
你将学到
  • 说得出数据、时间、资金、心态四道门槛各自的具体表现,而不是笼统地说「需要一定基础」
  • 对照四道门槛的「最低配置」自查一遍,判断自己现在到底缺哪一样、缺多少
  • 认得出四种「你其实不该现在开始」的客观信号,以及每一种对应的替代做法

你大概经历过这么一个晚上:刷到一条漂亮的净值曲线,配文说这是某套规则跑出来的,你心里冒出一句「我是不是也能搞一套」。然后你去搜「散户怎么开始做量化」,搜出来的答案分成对立的两派——一派说「散户玩这个纯属送钱,别碰」,另一派说「现在工具这么方便,人人都能上手」。

这两派吵得很热闹,但它们有个共同点:都没告诉你,你到底缺什么、缺多少。 一个只说你不行,一个只说你行,谁都不肯把清单列出来让你自己对。

这一篇就是那张清单。先说清楚这里说的量化是什么:把「什么时候买、什么时候卖、买多少」写成事先定死的规则,交给程序按规则执行,而不是临场看盘拍脑袋。 至于它整体上在做什么、和你想象的差在哪,量化到底在做什么 那篇是入口。至于什么性格的人天生不适合走这条路、什么样的预期从一开始就是错的,什么样的人不适合做量化 专门讲那件事。

这一篇只管一件事:客观条件。 不谈你是什么样的人,只谈你手上有什么——有多少数据、有多少时间、有多少钱、有多少不动手的定力。四道门槛,每道我都给你三样东西:它长什么样、最低配置是多少、以及什么情况下你其实不该现在开始。

第一道:数据

先打个比方

你要给一个人做健康分析,手上是一本体温记录本。

本子是别人抄给你的。翻开一看:有几天空着,那几天没量;有一天写着 36.8,但小数点的位置看着可疑;还有一页的字迹和别处不一样,是事后补记的——补记的那天,记的到底是当天量的还是后来推算的,没人说得清。

你依然可以拿这本子算出一个漂亮的平均值、画出一条曲线、得出一个结论。结论会很像那么回事,但它是这本子的结论,不是那个人的结论。

这对你的判断意味着什么

数据这道门槛最容易被低估,因为它不像钱那样一眼能看见缺口。你打开行情软件,数据就在那儿,免费的,看上去无穷无尽。

真正的问题不是「有没有数据」,是「这份数据说的是不是你以为的那件事」。三处最常见的破绽:

一是口径不一致。 同一只股票,同一天的收盘价,两个数据源给你的数不一样——这不是谁抄错了,是两边算复权的方式不同。复权就是把分红送股这些事对价格的影响倒推回去,让不同时期的价格能放在一起比。倒推的算法有好几种,各家选的不一样,结果自然不一样。你在 A 家做的研究,拿到 B 家的数据上复现,对不上,你会怀疑自己写错了,其实是两把尺子的刻度不同。

二是时点错位。 一份财报的数字,你今天在数据库里查得到,不代表当时的人也查得到——报告期结束到公告发布之间隔着一段时间,而很多数据表把这个数字直接挂在报告期上。你按报告期取数做研究,等于用了当时还没公布的信息。这件事的机制、以及一个正经数据库要怎么防它,时点数据 那篇拆得很细,这里只提醒你:免费数据集在这一项上基本不做保证。

三是已经消失的那些。 退市的、被合并的、改了代码的,很多现成数据集里直接就没了。你在一份「活到今天的样本」上做研究,得出的结论天然偏乐观——因为已经死掉的那些,从来没进过你的样本。

它在系统里长什么样

有意思的是,做这行的开源项目自己把这件事写得比谁都直白。

微软开源的量化研究框架 qlib,提供了一套从公开财经网站采集数据的脚本。它在那套脚本的说明里主动写了一句提醒,大意是:请特别注意,这些数据是从公开财经网站采集的,可能并不完美;如果你手上有高质量的数据集,我们建议你用自己的。 一个项目在自己提供的免费数据旁边亲手贴上这样一句话,本身就是一个信号——它不是在推卸责任,是在告诉你「这一档的数据,用来学习可以,用来下判断你得自己掂量」。

它的数据文档里还有一段讲复权的说明,说的正是上面第一处破绽:价格数据看起来和实际成交价不一样,因为它们是复权过的;而不同数据源复权出来的价格会有差异,因为各家调整的方式不同;qlib 自己的口径是把每只股票在首个交易日的价格归一化为 1。

这句话的价值不在于那个具体口径,而在于它把口径写了出来。 你手上那份数据的口径写在哪儿?如果你答不上来,这就是缺口本身。

另一边,做数字货币的 freqtrade 有一个专门下载历史行情的命令。它的文档说:不加参数时,默认下载最近一段时间的数据,具体默认天数以你手上那个版本为准;而且它特意提醒,这个下载命令不管你的策略需要多长的「预热期」——预热期就是指标开始算之前要先喂进去的那段历史,你得自己多下一些。文档里还有一条更能说明问题的备注:某些交易所根本不提供历史 K 线数据,用那家的人只能换一条更慢的路子去凑。

同一个世界里,有的地方数据唾手可得,有的地方压根没有。 数据的可得性不是一个「有或没有」的开关,它是按品种、按市场、按你愿意付多少钱分档的。

具体表现与最低配置

你缺不缺数据这道门槛,用三个问题就能自测。拿你打算用的那份数据,回答:

  1. 它是谁家的?采集自哪里?
  2. 价格是不是复权过的,用的哪一种口径?
  3. 已经退市的品种还在不在里面?

最低配置是:这三个问题你都答得上来。 注意,不是「你的数据必须是最贵的那档」——是你必须知道自己手上这份是哪一档、缺哪一块。知道自己用的是打折货,和以为自己用的是正品,是完全不同的两种处境。

什么情况下你其实不该现在开始:如果你打算从行情软件里手工导出表格,且不打算核对上面三个问题中的任何一个。这种情况下你后面所有的功夫都会建在一个你没检查过的地基上——不是说一定塌,是塌了你都不知道为什么塌。此时更划算的动作是:先只做「读懂别人的报告」这件事,等你能对着别人的数据问出这三个问题,再考虑自己动手。

第二道:时间

先打个比方

老式收音机上有一个调台旋钮。你转一转,噪音里冒出人声,再微调一下,声音清亮了,成了。

现在把它换成一台有十个旋钮的机器,每个旋钮都会影响其他旋钮的效果。你把第一个调好了,去调第二个,回头发现第一个又不对了。你不知道该退回去还是往前走,也不知道现在这个「听着还行」是真的对了,还是你耳朵听久了习惯了。

一个旋钮是手艺活,十个互相干扰的旋钮是另一种东西——它吃掉的不是技巧,是时间。

这对你的判断意味着什么

绝大多数人对时间成本的估算,是「写代码要多久」。这个估法从一开始就错了,因为写只是最短的那一段。真正吃时间的是三件别的事:

等结果的时间。 你改了一处,要重新验证一遍才知道好没好。验证一遍要多久,取决于你算的东西有多重、数据有多长。这个循环你一天能转几遍,直接决定了你一个月能推进多远。

排除错误的时间。 结果不对的时候,你得判断是规则本身不行,还是你哪里写错了、数据哪里缺了一段、口径哪里没对齐。这三种情况长得一模一样,都表现为「曲线难看」。分辨它们是这行最耗人的部分,而且它没有捷径。

等样本的时间。 这是最反直觉的一条。就算你的规则真的成立,你也需要足够多次的交易才能看出来它成立——而交易次数是市场给的,不是你想要就有的。

它在系统里长什么样

freqtrade 的常见问题文档里有一段算术,我认为是这一节最值得你看的东西。

它在回答「为什么自动调参要跑这么久」的时候,举了一个当时版本下的粗略估算:假设有 8 种触发条件、9 个筛选条件(每个条件哪怕只试 10 个取值)、再加止损也试 10 个取值——把这些组合起来,可能的组合数量已经是天文数字,文档给出的量级是数百亿。然后它写了一句我很喜欢的话,大意是:你跑了十万次评估?恭喜,你大约走完了搜索空间的十万分之一。

这段算术是文档为一个较早版本写的粗略示意,具体数字不必当真。该当真的是那个量级。

同一份文档还写着:默认情况下自动调参只跑一个不大的轮次,建议你反复跑到累计上万轮;而跑上千轮的耗时,从二十分钟到好几天都有可能,取决于你的机器、数据长度、品种数量和产生的交易笔数。文档在这一节的开头直接写了一句:用自动调参找出一套好策略是需要时间的,请耐心。

我要提醒你别误读这段:它不是在说「你应该穷举」。 恰恰相反,一个把参数试到「历史上最漂亮」的结果,几乎注定是把过去的偶然当成了规律——这件事叫过拟合过拟合的机理 那篇讲得很透。这段算术真正的用处是杀死一个直觉:「多调调参数就能调出来」这句话,错的不是方向,是量级。 你以为差几十次,实际差几个数量级。既然穷举走不通,你就必须靠想清楚逻辑来大幅缩小范围——而想清楚,同样是要花时间的。

具体表现与最低配置

时间门槛的可怕之处在于它不是一次性的支出,是持续的占用。最低配置不是「总共多少小时」,是「每周能不能稳定拿出一个不被打断的时间块」。

为什么强调不被打断?因为上面说的排除错误那一步,需要你把好几件事同时装在脑子里——数据到哪一段、改了哪几处、上一次的结果是什么。这个上下文一旦断掉,重新装回来的成本极高。碎片化的十分钟乘以三十次,远远不等于连续的五个小时。

还有一个时间维度经常被忽略:你愿意给这件事多长的判断周期。 一套慢一点的规则,一年可能只出手十几次;十几次的结果,在统计上说明不了任何事。如果你的心理预期是「三个月内必须看到结论」,那么你和这件事在时间尺度上根本不匹配。

什么情况下你其实不该现在开始:如果你每周能拿出的是碎片化的零散时间,同时又期望在一个季度内得到「行还是不行」的答案。这两条同时成立时,你会在时间还没到的地方被迫下结论,而被迫下的结论往往是错的。此时更划算的动作是:把野心缩小到「一条规则」而不是「一套系统」——比如只研究「我现有的操作里,止损这一条到底该怎么设」。范围小十倍,需要的时间也小十倍。

第三道:资金

先打个比方

打车有起步价。你从小区门口到隔壁小区,路程一公里,计价器跳出来的还是那个起步价。同样这笔钱,你打十公里也是这个价打底。

路程越短,你为「起步」这件事本身付的比例越高。 短途不是贵一点,是结构上就不划算——不管你怎么优化路线,那个底价它就在那儿。

这对你的判断意味着什么

资金门槛最常被说成「钱少不配玩」,这话既伤人又不准确。准确的说法是:钱少的时候,你被迫做出的每一个妥协,都会削掉一点本来就不厚的边际。

固定成本吃掉小本金,主要走三条路。

第一条是最低收费。 券商佣金通常有一条「不低于某个金额」的门槛。金额大的时候按比例走,金额小到某条线以下,你交的就是那个固定数——摊回到成交额上,你的实际费率会往上飙。而且这笔钱买一次卖一次各收一次。这条账怎么算、临界金额怎么推,手续费与印花税 那篇给了完整的算法,站内也有一个交易费用计算器可以把你自己的数填进去跑一遍。这一步别跳过——它是这四道门槛里唯一能被你当场算出确切数字的一道。

第二条是交易单位。 你不能买 3.7 股,也不能在 A 股市场买 21 股。最小单位的存在,让「按比例分配仓位」这件事在小资金上直接失真:你算出来该买 3.6 手,实际只能买 3 手,误差百分之十几;而同样的算法在大资金上,误差小到可以忽略。

第三条是分散的代价。 分散持有很多个品种,是听上去最稳健的做法。但每一个品种都是一笔独立的交易,都要各付一次起步价。本金越小、分得越散,你为「分散」这件事支付的比例越高。 分散依然有它的道理,但它不是免费的,你得知道自己在为它付多少。

它在系统里长什么样

这三条在开源系统里都留下了明确的痕迹。

qlib 的交易所模块里有一个参数叫交易单位,源码注释直接写着「中国 A 股市场为 100」。它还有一个专门的取整函数,注释里举了一个一眼就懂的例子:要交易 321 股、交易单位是 100 时,实际成交 300 股。 那 21 股不是被舍入,是根本下不出去。同一个模块里还有一个最低成本参数,带着一个默认值——这些都是源码快照里的默认设定、可以配置,你的实际值以你的券商合同和交易所规则为准。

freqtrade 那边处理的是另一种形态。它的配置文档解释说,最小下单金额取决于交易所和品种,通常在交易所的说明页上能查到;文档还演示了一个更细的考量:算最小下单金额时,除了那条硬门槛,还要往上留一点余量,因为价格会动、还要给止损留出空间。它甚至专门有个配置项,防止最后一笔的金额被压得太小而被交易所拒单。

我想让你看见的是这些设计背后的同一件事:在真实的交易系统里,「金额」不是一个可以无限细分的连续数,它是有颗粒度的、有底线的、有最小起跳高度的。 你的本金越小,这些颗粒相对越大。

具体表现与最低配置

这道门槛有一个能当场算的自测,我建议你现在就算:

拿你打算投入的本金,除以你想同时持有的品种数,得到单个品种的仓位金额。再拿这个金额去对最低佣金的临界线——临界金额等于最低收费除以佣金比例,这两个数在你的券商合同里。如果你算出来的单笔仓位低于那条临界线,你的实际费率就是标价的好几倍,而你甚至不会在账单上察觉到。

最低配置是:这个除法算出来的结果,落在临界线之上。 达不到的话,你有两个诚实的选项——要么减少品种数(接受集中度更高),要么先不做实盘只做研究。不诚实的那个选项是硬上,然后把持续渗漏的成本归因为「运气不好」。

什么情况下你其实不该现在开始:本金小到「按你想要的份数分完之后,每一份都在起步价以下」。这不是志气问题,是算术问题。此时把研究继续做下去完全没问题——研究不花交易成本,你随时可以在纸面上把方法磨到位,等本金够了再上真金白银。顺序颠倒过来才是真的浪费。

第四道:心态

先打个比方

你在阳台种了一棵苗,说好每周浇一次水,别的什么都不做。

第三天你觉得叶子有点蔫,挖开土看了看根。第五天你觉得阳光不够,搬了个位置。第十天你换了一种肥。第二十天苗死了。

现在问你一个问题:它是被什么弄死的?

你答不上来。不是因为你笨,是因为你在这二十天里同时改了四件事,任何一件都可能是原因,也可能全都不是。你付出的代价不只是一棵苗,还有「下次该怎么种」这个知识——你什么都没学到。

这对你的判断意味着什么

心态这道门槛,通常被说成「要能扛住亏损」。这个说法太浅了,而且容易让人觉得这是个意志力问题、咬咬牙就过去了。

它真正的杀伤在于归因

假设你的规则连亏了五笔,你忍不住手工干预了一次——跳过一个入场信号,或者提前砍掉一个还没到止损的仓位。这一下之后,你的记录变成了一堆混合物:既不是那套规则的成绩,也不是你直觉的成绩,是两者随机拼接的产物。

于是最贵的东西丢了:你失去了判断这套方法到底行不行的能力。 亏掉的那几笔钱是有限的、可量化的;而「这一整段时间白跑了、什么都没学到」这件事,没有账单,却比亏损贵得多。

更麻烦的是,干预往往发生在最不该发生的时刻。一套方法在连亏之后干预,和在连赚之后加码,是同一种心理的两面——都是被最近几笔的结果牵着走。而最近几笔的结果,恰恰是你手上信息量最小的那部分证据。至于一段回撤要花多长时间才能爬回来、为什么这个「多长时间」比回撤深度更折磨人,恢复期 那篇算过。

它在系统里长什么样

这一节我不打算讲代码,讲两个问题的存在本身

freqtrade 的常见问题文档里,并排放着这样两个条目:

「我已经等了五分钟,为什么机器人还没做任何交易?」

文档的回答很朴素:取决于你的规则、品种范围和当时的行情,可能要花上几小时甚至几天才找到一个合适的入场位置,请耐心。它还补了一句很实在的话——回测能大致告诉你会有多少笔交易,但没法保证它们均匀分布在时间上,你完全可能一天出现二十笔,然后一整周一笔都没有。

「我已经做了 12 笔交易了,为什么总盈亏还是负的?」

文档的回答更直接,大意是:理解你的失望,但 12 笔实在说明不了任何事;回测里那些结论是建立在几千笔交易之上的,而且即便如此,某些品种上你交易了几十上百次仍然是亏的。

这两个问题为什么会被写进官方文档?因为它们被问了太多次。 请注意提问者是些什么人——他们已经装好了环境、读过了文档、跑通了程序,技术上一点问题没有。他们卡住的地方,是五分钟和 12 笔。

这就是心态门槛的真面目:它不是知识门槛,是「知道了也还是会那么干」的门槛。 你现在读到这里,完全同意 12 笔说明不了任何事;但真轮到你自己连亏 12 笔的时候,那个「同意」值多少钱,是另一回事。

顺带说一句,这个项目在首页写着一段很硬的话:本软件仅用于教育目的,不要投入你输不起的钱,使用风险自负,作者不对你的交易结果负责;并且,先用模拟盘跑,在你真正理解它是怎么运转的、以及该预期什么样的盈亏之前,不要投入真钱。它的入门文档结尾也留了一句:只投你输得起的钱。 一个工具的作者在自己的首页反复写这些,不是客套。

具体表现与最低配置

心态这道门槛没法用「我觉得我能扛」来通过——所有人在开始之前都觉得自己能扛。它只能用事先写下来的规则来通过。

最低配置是:在开始之前,你已经写下了「我什么时候会停」。 注意是事先,不是亏了以后现想。这句话至少要包含两样东西:一个明确的停止条件(连续多少笔、回撤到什么程度、或者到某个时间点),以及停下来之后你要做什么(复盘、缩小规模、还是彻底放弃)。写在纸上的规则和记在心里的打算,在连亏第五笔的那个晚上,是完全不同的两样东西。

什么情况下你其实不该现在开始:如果你在过去的手工交易里,有过「说好止损却没止」「说好只买这些却临时加了别的」的记录。这不是道德指控,是一个客观信号——同样的模式换到程序上不会自动消失,只会变成更隐蔽的形式(比如反复重启、反复改参数)。此时最划算的动作,是先把这件事查清楚:你的交易流水里其实存着一份关于你自己的记录,你的交易流水里藏着一份体检报告 讲的就是怎么读它。先量自己,再量市场。

四道门槛不是并列的

把四道并排放一下,你会发现它们的性质完全不同:

门槛 具体表现 最低配置 能不能绕开
数据 口径不明、时点错位、消失的样本没进样本 说得出数据来源、复权口径、退市品种在不在 可以——花钱买,或缩小到数据可靠的范围
时间 等结果、排错、等样本,三段都很长 每周一个不被打断的时间块,以及匹配的判断周期 可以——把范围缩到十分之一
资金 最低收费、最小交易单位、分散的固定成本 单笔仓位落在最低佣金临界线之上 不能——这是算术,不是态度
心态 连亏时干预,导致结果无法归因 事先写下的停止条件 不能——也不能外包给任何人

资金门槛最硬。 它不讲道理,也不看你多努力,它就是一个除法。好在它也最容易检测——十分钟就能算完。

心态门槛最贵。 前三道你都可以花钱、花时间、缩小范围来处理,唯独这一道,没有任何人能替你完成。而且它是唯一一道「失败时你不知道自己失败了」的门槛:数据不够你会看到报错,时间不够你会看到进度停滞,钱不够你会看到账单,但心态不够,你只会看到一堆自己都解释不清的记录。

数据和时间门槛是可以谈判的。 它们的解法不是「凑齐再上」,而是「把野心缩到手上资源撑得住的尺寸」。想研究整个市场几千个品种,你需要的是一整套数据基建;想搞清楚自己手上这几个品种的止损该怎么设,需要的东西少得多,而后者对你的实际帮助未必更小。

最后提醒一件事:这四道门槛全部通过,也不意味着你会赚钱。 它们是入场的必要条件,不是充分条件。开源项目的入门文档里就有一句很清醒的话,大意是:这件事很难,公开流传的策略大多数表现并不好,因为把一套方法在各种环境下都做到能用,要花的时间和精力远超想象。门槛只保证你不会因为最基础的资源缺口而白白输掉,它保证不了别的。

⚠️ 风险提示

本文讨论的是做量化研究的客观资源门槛,不构成任何投资建议、买卖信号或收益承诺,也不推荐任何工具、平台或品种。文中引用的默认值、参数与算术示例,全部来自公开源码与文档的指定快照版本,是阅读代码与文档得出的机制说明,不是运行结果,也不代表任何现行费率、税率或市场规则;你的实际数值请以你的券商合同、交易所规则与你手上的软件版本为准。通过全部四道门槛不代表能够盈利。 完整风险提示见 免责声明

小结

  • 数据门槛的实质不是「有没有数据」,是「这份数据说的是不是你以为的那件事」:口径、时点、消失的样本,三处都要问。最低配置是你说得出自己用的是哪一档
  • 时间门槛吃掉的不是写代码的时间,是等结果、排错、等样本这三段。最低配置是每周一个不被打断的时间块,外加一个和你的方法节奏匹配的判断周期。
  • 资金门槛是四道里唯一能当场算出确切数字的:本金除以品种数,去对最低佣金的临界线。低于那条线,你的实际费率是标价的好几倍。
  • 心态门槛的杀伤不在亏损,在归因——一旦中途干预,你既没执行规则也没执行直觉,最贵的损失是你失去了判断这套方法行不行的能力。最低配置是一条事先写下的停止规则。
  • 四道不是并列:资金和心态不可协商,数据和时间可以靠「缩小野心」来谈判。
  • 四道全过也不等于赚钱。门槛只保证你不会输在资源缺口上。

一句话说完这篇:开始之前先算三个数——你的数据是谁家的、你每周能连续拿出几小时、你的钱分完之后每份还剩多少;这三个数不体面没关系,怕的是你从来没算过,就已经把钱投进去了。

内容有错、看不懂、或想看下一篇?告诉我们 →

本文为投资教育整理,不构成任何投资建议;不荐个股/基金、不预测点位、不承诺收益。关键数据与结论请结合权威来源自行验证,并见风险免责声明