· 线性代数

1 · 向量与向量空间

现实世界的数据如何变成数学能处理的对象?从几何、代数到 embedding 直觉。

本节解决一个问题:现实世界的数据,怎么变成数学能处理的对象? 答案是向量。


一、什么是向量(Vector)

向量有三种等价视角,都要熟悉:

① 几何视角:空间中一个带方向和长度的箭头,从原点指向某点。

② 代数视角:一列有序的数。二维向量 v = [3, 2] 表示「向右 3、向上 2」。

③ 数据视角:一组特征的打包。比如一套房子 = [面积, 房间数, 楼层, 房龄],一个 4 维向量。

应用直觉:在大模型里,每个词被映射成一个几百上千维的向量(word embedding)。「国王 − 男人 + 女人 ≈ 女王」之所以成立,就是因为语义被编码进了向量的方向和位置。向量是 AI 处理一切非数值数据(文本、图像、音频)的第一步。

二、向量的基本运算

加法:对应分量相加,几何上是「首尾相接」。

数乘(Scalar Multiplication):每个分量乘同一个数,几何上是「拉伸或翻转」这个箭头。

这两个运算是整个线性代数的地基——「线性」二字指的就是「只允许加法和数乘」这两种操作。

内积(Dot Product):两个同维向量对应分量相乘后求和,结果是标量。几何含义:反映两向量的「对齐程度」;垂直时内积为 0,同向时取最大值。

投影:x 在方向 b 上的投影长度,当 b 为单位向量 û 时,投影向量为 (ûᵀx) û

三、线性组合与张成空间

线性组合:把若干向量各自数乘后相加。

张成空间(Span):一组向量所有线性组合能到达的全部点的集合。

关键洞察:张成空间的维度,取决于向量组中真正「不同方向」的数量。

应用直觉:神经网络某一层能表达的「特征空间」,本质就是权重向量所张成的空间。若有效独立方向太少(矩阵秩低),表达能力会被限制在低维子空间里。

四、线性相关与线性无关

线性无关:没有任何一个向量能由其他向量线性组合得到——每个都贡献了「新的方向」。

线性相关:至少有一个向量是冗余的。

应用直觉:特征之间「线性相关」= 信息冗余。降维(如 PCA)做的就是去掉冗余,保留真正线性无关的方向。

五、基与维度

基(Basis):一组线性无关且能张成整个空间的向量,是空间的「最小坐标系」。

维度(Dimension):基里向量的个数。ℝⁿ 的维度是 n。

应用直觉:embedding 维度(如 768、1536)就是你给语义空间选的「基的数量」。维度越高,能区分的概念越细,但算力和数据需求也越大。

六、跨领域应用(节选)

AI / NLP — 词向量语义类比

类比公式:女王 ≈ 国王 − 男人 + 女人。语义关系被编码为向量差;RAG、推荐、语义搜索的检索阶段,本质都是在向量空间里找最近邻。

金融 / 量化 — 投资组合作为线性组合

每种资产收益率是一个向量,组合收益 = 各资产向量的加权线性组合。分散投资,就是在叠加不同方向的向量以抵消风险。

生物医学 — 基因表达量向量

样本相似性 = 特征向量之间的距离(如欧氏距离)。k-NN、聚类等方法底层都在比较向量。

七、小结

概念一句话理解典型应用
向量一列数 / 一个箭头 / 一组特征embedding、特征向量
线性组合加法 + 数乘的结果神经网络加权求和
张成空间能到达的所有点模型表达能力
线性无关没有冗余方向去除冗余特征
基与维度最小坐标系及其大小embedding 维度选择

下一节:矩阵与线性变换 —— 数据表示成向量之后,如何对整个空间做统一操作?