摘要:量化分析师需要掌握概率、统计、线性代数、微积分与随机微积分等数学基础,并通过编程实践建立模型和策略。文章提供了详细的学习路径和作业,涵盖从基础概念到高级金融模型的全面内容。职业发展路径包括量化研究员、开发工程师、交易员和风险分析师,薪资水平较高,竞争激烈。
主推文
如果明天要重新开始,我该如何成为量化分析师
https://t.co/bVArkKPyv1
2025年,顶级机构的初级量化分析师总薪酬为30万至50万美元。
金融科技领域AI/ML招聘量同比增长88%。
这篇文章包含了我当初踏上这条道路时,希望有人能给我指明方向的全部内容,而且是按照你应该学习的顺序逐条列出的。
这条学习路径就像电子游戏的关卡,你无法跳过任何层级。
每个概念都建立在前一个概念之上。但如果你真的付出努力,而不是观看那些无聊的YouTube金融视频,那只是在浪费时间,而是进行真正的解决问题的工作,你可以在大约18个月内从一无所知变得有所成就。
免责声明:
本文不构成投资建议,投资有风险,入市需谨慎。
我的个人项目 - @coldvisionXYZ
忘记你对交易的所有认知
大多数人认为量化交易就是挑选股票,对特斯拉有看法,预测业绩。
量化交易本质上是数学。
你主要是在处理统计关系、定价效率不足以及市场作为由人类运行的复杂系统所固有的结构性优势。
第一部分:概率是不确定性的语言
量化金融中的一切最终都可以归结为一个问题:
可能性是多少?这些可能性是否有利于我?
这就是概率。如果你没有深入理解概率,这篇文章的其他内容对你来说都无关紧要。
条件思维
大多数人以绝对的方式思考。某件事是真实的,或者不是。
量化分析师则以条件的方式思考。根据我所知道的信息,这件事发生的可能性有多大?
在B发生的情况下A发生的概率等于A和B同时发生的概率除以B发生的概率。这个公式有深远的意义。
一只股票在60%的日子里上涨——这是基础率。但当成交量高于平均水平时,它有75%的时间会上涨。
这种条件概率是真实有效的。原始的60%数据是嘈杂的虚假信息。
贝叶斯定理
你的更新后信念等于:
(如果你的假设为真,你看到这个数据的可能性) × (你的先验信念) / (在任何假设下看到这个数据的总概率)。
分母涵盖了所有假设。
实际上,你是通过蒙特卡洛抽样来计算这个的。
但逻辑是相同的。贝叶斯法则就是你实时更新自己信念的方法。
一个模型说某只股票应该值50美元。财报公布,收入超出预期3%。贝叶斯后验概率会上调。交易员中更新最快最准确的人才能赚钱。
期望值和方差是你最好的两位朋友
期望值是你信念的体现。
方差是你承担的风险。
如果你的策略有正的期望值,并且你能承受方差,那么你很可能会赚钱。
Level 1作业(3-4周,每天2小时):
1. 阅读
Blitzstein & Hwang,《概率导论》(哈佛大学免费PDF)。第1-6章的所有习题。
2. 编程
模拟10,000次硬币抛掷,用可视化方法验证大数定律。
3. 编程2
实现一个贝叶斯更新器,输入先验和似然函数,输出后验分布。
第二部分:统计学
当你掌握了概率论,就需要学会倾听数据。
这就是统计学,统计学教给你的第一课是:“看起来不像虚假信息的,其实大多是噪声干扰的虚假信息”。
假设检验就是虚假信息检测器
你建立一个模型,回测结果显示年化收益率15%。这是真实的吗?
设立原假设H₀:“该策略的预期收益率为零”。
计算检验统计量。
计算p值——在H₀为真的情况下,出现如此好结果的概率。
但如果你测试1000个随机策略,其中50个会因为纯属偶然而出现p值低于0.05。
这就是多重比较问题。
你的解决方法是用博尔特费里尼校正,将显著性阈值除以测试次数
或者用本杰明-霍奇伯格方法控制错误发现率。
每个初学者都会严重高估自己发现的非虚假信息数量。你前10个策略都会是噪声干扰的虚假信息。现在接受这一点,能帮你省下很多钱。
回归分析:分解收益
线性回归y=Xβ+ϵ是核心工具。
在金融领域,你将策略收益对已知风险因子进行回归:
截距项α是你的阿尔法
无法用已知因子解释的收益。如果考虑了因子后α为零,你的“优势”只是被伪装的市场敞口。
OLS估计量:
最重要的数值是α。
使用纽维-韦斯特标准误,因为金融数据存在自相关性和异方差性,默认的OLS标准误是错误的。使用它们就像在挡风玻璃有裂痕的情况下开车。
最大似然估计
给定数据x₁,…,xₙ,来自参数为θ的模型:
令导数等于零并求解。(或者直接结束了)
MLE是校准金融模型的通用方法:给波动率拟合GARCH模型,估计跳跃扩散参数,根据市场报价校准期权定价模型。
它渐近有效,对于大样本来说,没有其他一致估计量的方差比它更低(即克拉默-拉奥下界)。
当公司里有人说是“校准”模型时,他们几乎总是指MLE。
Level 2作业(4-5周):
1. 阅读
Wasserman,《统计学全貌》,第1-13章。
2. 编程
用yfinance下载真实股票收益,检验正态性(会失败)。通过MLE拟合t分布,进行比较。
3. 编程
用statsmodels对股票组合运行法玛-弗伦奇三因子回归。
4. 编程
进行排列检验:打乱日期10,000次,将打乱后的表现与实际表现进行比较。
第三部分:线性代数
线性代数听起来很枯燥。它是支撑所有事物的工具:投资组合构建、主成分分析、神经网络、协方差估计、因子模型。没有矩阵方面的熟练知识,你就无法成为量化分析师。
以矩阵思维思考
协方差矩阵Σ描述了每种资产相对于其他资产的变动情况。对于500只股票,Σ是一个500×500的矩阵,包含125,250个唯一条目。投资组合方差可以简化为一个表达式
这个二次型是马科维茨投资组合理论、风险管理以及一切金融理论的核心。
在股票宇宙中,真正重要的是特征值
观察一个包含500只股票的宇宙,前5个特征向量就能解释70%的全部方差。其余部分都是噪声。
第一次使用特征分解时,整个世界都会改变。观察一个包含500只股票的宇宙,前5个特征向量就能解释70%的全部方差。这是降维操作,也是因子投资的理论基础。
第三阶段作业(4-6周):
1. 观看
全部观看吉伯特·斯特朗的MIT 18.06课程。必须完成。
2. 阅读
斯特朗《线性代数导论》。完成所有习题。
3. 编程
对标准普尔500指数收益进行主成分分析分解。绘制特征值谱。识别前三个成分。
4. 编程
从零开始实现马科维茨均值-方差优化。
第四部分:微积分与优化
微积分是变化的语言。在金融领域,一切都在变化:价格、波动率、相关性,整个概率分布每秒都在变化。微积分描述并利用这些变化。
导数(数学意义上的):出现在每个神经网络的反向传播和每个希腊字母计算中。
泰勒展开:
对冲策略是第一阶近似。
伽马对冲增加了第二阶修正项。
而伊藤微积分与普通微积分不同的原因,正是由于随机过程的第二阶泰勒项不会消失。记住这一点
第四阶段作业(4-5周):
1. 阅读
博伊德与范登伯格《凸优化》(斯坦福大学免费PDF),第1-5章。
2. 编程
从零开始实现梯度下降算法。最小化罗森布罗克函数。
3. 编程
用cvxpy求解包含交易成本约束的投资组合优化问题。
第五部分:随机微积分
在学习随机微积分之前,你只是个喜欢金融的数据科学家。
学完之后,你就成了量化分析师。量化金融专家,听到了吗?
这里你将学习如何在连续时间中建模随机性,从第一性原理推导出布莱克-斯科尔斯方程,并理解万亿级衍生品市场为何以这种方式运作。
布朗运动:纯粹的随机性,被形式化
布朗运动(维纳过程)W_t是一个连续时间随机游走:
• W_0 = 0
• 对于t > s,增量W_t - W_s ~ N(0, t - s)
• 非重叠增量相互独立
• 路径是连续的但处处不可微
所有其他内容都依赖的关键洞察:dW_t具有"大小"dt,这意味着(dW_t)² = dt。这听起来像技术细节,但这是量化金融中最重要的事实。
几何布朗运动用于建模股票价格:
伊藤引理
在普通微积分中,df = f'(x)dx。你进行泰勒展开,而(dx)²项是无穷小,因此可以忽略。
但当x是一个随机过程时,(dW_t)^2 = dt是一阶项。你不能忽略它。
伊藤引理:
将其应用到期权价格上,就得到了Black-Scholes公式。这个公式是整个衍生品行业的核心引擎。
从零推导Black-Scholes方程
拿出笔和纸跟着推导。
步骤1:设V(S,t)为一个期权价格。应用伊藤引理:
步骤2:构建一个德尔塔对冲组合Π=V−∂V/∂S·S。计算dΠ:
dW_t项完全抵消。该组合是局部无风险的。
步骤3:无风险组合必须获得无风险利率:dΠ=rΠ dt
步骤4:代入并重新排列:
这就是Black-Scholes偏微分方程。
注意发生了什么——漂移项μ消失了。期权价格并不依赖于股票的预期收益率。风险偏好不重要。你可以像所有人都是风险中性的一样给期权定价。第一次真正理解这一点时会让人感到震惊。
对欧式看涨期权求解该PDE,执行价为K,到期日为T,得到:
希腊字母
• 德尔塔Δ:股票每变动1美元,期权的变动量。你的对冲比率。
• 伽马Γ:德尔塔变化的速度。你的凸性风险暴露。
• 西塔Θ:时间衰减。通常对长期期权而言为负。
• 伐伽V:对波动率的敏感度。大多数衍生品交易的利润来源。
• rho ρ:对利率的敏感度。
德尔塔告诉你对冲比率。伽马告诉你需要多频繁地重新对冲。西塔是持有成本。伐伽是波动率交易部门的核心业务。
第五级作业(6-8周——最难级别):
1. 阅读
Shreve,《金融中的随机微积分II》。这是行业标准教材。
2. 替代读物
Arguin,《随机微积分导论》(更新、更易理解)。
3. 推导
对服从几何布朗运动的S,应用伊藤引理到f(S)=ln(S)。得到−σ^2/2项。
4. 推导
从德尔塔对冲论证推导完整的Black-Scholes方程。
5. 编程
从零开始实现Black-Scholes模型。与蒙特卡洛方法比较。验证收敛性。
Polymarket
这是目前世界上最有意思的市场,其背后的数学原理贯穿了本文所有内容:概率论、信息论、凸优化、整数规划
LMSR如何定价信念
对数市场评分规则(LMSR)由Robin Hanson发明,支撑着自动化预测市场。n个结果的代价函数为:
其中q_i跟踪第i个结果的未结头寸,b是流动性参数。第i个结果的价格为:
这就是softmax函数——支撑着每个神经网络分类器的函数。
价格总是加总为1,始终位于(0,1)区间内,并且在无限流动性下始终存在。做市商的最大损失被限定为b ln(n)
量化职业图景
四种典型角色:
量化研究员
最被追捧的职位,能在海量数据中发现模式,构建预测模型,设计交易策略。需要博士水平的数学/统计/机器学习知识,或卓越的本科成就。在Jane Street这类公司,量化研究员会使用数以万计的GPU进行工作。
量化开发工程师
中间裂开的人,主要是建造者。交易平台、执行引擎、实时数据管道。让研究人员的模型真正进行交易。需要生产级的C++/Rust/Python,低延迟系统。
量化交易员
要么是最大的激进玩家,要么是裂开最严重的家伙,通常是决策者。管理资金,控制风险,做实时决策。薪酬差异最大——在特殊年份可达数百万美元。
风险量化分析师
最裂开的人或只是极其有经验的公司人士,通常是守门人。模型验证、风险价值(VaR)、压力测试、监管合规。职业更稳定,天花板较低。新兴的AI/ML量化角色(通过深度学习生成信号)增长最快,2025年招聘量同比上涨88%。
薪资水平:
顶级层级(Jane Street、Citadel、HRT)
应届生总薪酬30万至50万美元+
中层(3-7年)55万至95万美元
高级(8年以上)100万至300万美元+
明星交易员/项目经理300万至3000万美元+
中层(Two Sigma、DE Shaw)
应届生25万至35万美元
中层(3-7年)35万至62.5万美元
高级(8年以上)57.5万至120万美元
明星交易员/项目经理不确定
Jane Street在2025年上半年的平均员工薪酬为140万美元/年。这只是平均水平
面试流程
简历筛选 ->
在线测评(通过Zetamac进行心算——目标50+,逻辑谜题) ->
电话面试(概率问题,赌博游戏) ->
超级日(3-5场连续面试,模拟交易,编程,白板推导)。
Jane Street故意设置难度过高的问题——他们测试你如何利用提示和协作解决问题。
他们最近的实习生中,超过三分之二学习计算机科学;超过三分之一学习数学。金融知识通常不是必需的。
最顶级的备考资源
周欣峰的《绿皮书》(《量化金融面试实战指南》)——200+道真实题目。
配合QuantGuide.io(量化领域的"LeetCode")
Brainstellar
Jane Street的Figgie纸牌游戏
完整工具箱
Python栈
数据处理:pandas,polars(Polars在处理大型数据集时速度是pandas的10至50倍)
数值计算:numpy,scipy
机器学习(表格数据):xgboost,lightgbm,catboost
机器学习(深度学习):pytorch
优化:cvxpy
衍生品:QuantLib(工业级,C++后端)
统计分析:statsmodels
回测:NautilusTrader
简易回测:backtrader,vectorbt(更易上手的起点)
量化研究:Microsoft Qlib(17K+星标,面向AI)
交易强化学习:FinRL(10K+星标)
C++和Rust
说实话,我对这部分一无所知。这是我找到的信息:
C++库:QuantLib,Eigen,Boost。
Rust:RustQuant用于期权定价,NautilusTrader采用Rust+Python范式(Rust用于速度,Python用于研究接口)。
数据源
免费:yfinance,Finnhub(每分钟60次调用),Alpha Vantage。
中端:Polygon.io(每月199美元,延迟低于20毫秒),Tiingo。
企业级:Bloomberg终端(约3.2万美元/年),Refinitiv,FactSet。
区块链:Alchemy(免费版含归档访问)。
求解器
Gurobi:最快的商业混合整数规划求解器,提供免费学术许可。对于组合套利至关重要。
Google OR-Tools:最强的免费求解器。
PuLP/Pyomo:Python建模接口。
阅读清单(按顺序)
数学基础
1. Blitzstein和Hwang《概率论导论》(哈佛大学提供的免费PDF)
1. Strang《线性代数导论》+ MIT 18.06课程
1. Wasserman《统计学全书》
1. Boyd和Vandenberghe《凸优化》(斯坦福大学提供的免费PDF)
1. Shreve《金融随机微积分I与II》
量化金融
1. Hull《期权、期货及其他衍生品》
1. Natenberg《期权波动率与定价》
1. López de Prado《金融机器学习进展》
1. Ernest Chan《量化交易》
1. Zuckerman《破解市场的男人》
面试准备
1. Zhou《量化金融面试实用指南》(绿皮书第1本)
1. Crack《华尔街的街角》
1. Joshi《量化工作面试问题》
竞赛
• Jane Street Kaggle(10万美元奖金)
• WorldQuant BRAIN(10万+用户,支付阿尔法信号)
• Citadel数据竞赛(快速入职通道)
• Jane Street月度谜题(难度高于面试题)
我早该知道的三件事
估计误差才是真正的敌人。
全凯利投注、无约束马克维茨模型、特征过多的机器学习模型——它们失败的原因都一样:过度拟合噪声数据。
数学在参数准确时表现完美。你永远无法获得真实参数。理论与实践之间的差距始终是估计误差,最优秀的量化交易员都是那些真正尊重这个差距的人。
工具已经普及,但信心尚未。
任何人都可以使用QuantLib、Polygon.io和PyTorch。技术是必要条件但非充分条件。优势存在于独特数据、独特模型或独特执行方式中,而不是更好的pip安装。
数学是护城河
AI可以编写代码并提出策略。但能推导出伊藤引理为何有额外项、能证明在风险中性测度下贴现价格是鞅、能在组合市场中判断凸松弛是紧的还是松的——这些数学素养区分了那些构建优势的量化交易员和那些借用优势的交易员。而借用的优势终将失效。
第二部分内容预告
第二部分将涵盖:奇异衍生品(障碍期权、亚式期权、回望期权)、随机波动率(赫斯顿模型校准)、跳跃扩散模型(默顿模型)、高级测度论(鞅表示定理、可选停时定理)、最优执行的随机控制(阿尔姆格-克里斯模型)、市场做市的强化学习、用于金融时间序列的Transformer架构、FPGA交易基础设施、WebSocket数据流、并行执行、使用Gurobi在数千个条件间进行组合套利的Frank-Wolfe算法。
数学难度升级。收入也随之增加。
如果明天重新开始我会如何成为量化分析师
5000 words· Original link ↗