奇异值分解与潜在语义分析(SVD/LSA)
SVD(奇异值分解)
任意矩阵 可分解为 :
- : 左奇异向量(列空间)
- : 对角矩阵(奇异值降序排列)
- : 右奇异向量(行空间)
截断 SVD:取前 个最大奇异值, 是最优 秩近似(Eckart-Young 定理)。
LSA(潜在语义分析)
将 SVD 用于词-文档矩阵:
- 构建 TF-IDF 加权的词-文档矩阵
- 对 做截断 SVD,保留前 维
- 词和文档被映射到同一 维语义空间
- 可通过余弦相似度计算词-词、文档-文档、词-文档相似度
LSA 解决了同义词和一词多义带来的词汇不匹配问题,但缺乏概率解释、不处理词序。后续被 pLSA 和 LDA 取代,但其降维思想仍是 NLP 经典基础。