什么是自然语言处理
自然语言处理(Natural Language Processing, 简称NLP)是计算机科学与语言学中关注于计算机与人类语言间转换的领域,是人工智能与语言学的交叉学科
NLP 就是让计算机理解人类的语言
发展简史
按技术范式划分
规则驱动时期(1950s-1980s)
1950年:艾伦·图灵提出"图灵测试",奠定NLP理论基础
1954年:乔治城-IBM实验首次实现俄英机器翻译(60余句),但过度乐观的预期导致1966年ALPAC报告后经费大幅削减
1960年代:代表性系统
- SHRDLU:受限"积木世界"中的对话系统
- ELIZA:模拟心理治疗的聊天机器人,暴露早期模式匹配的局限性
特点:依赖语言学专家手工编写规则,系统脆弱、泛化能力差
统计方法兴起(1980s-2010s)
关键转折:摩尔定律提升算力 + 乔姆斯基形式语言学式微 → 机器学习成为主流
技术突破:
- 隐马尔可夫模型(HMM)用于词性标注
- 统计机器翻译(IBM主导),利用双语语料库训练概率模型
- 条件随机场(CRF, 2001)成为序列标注标准方法
特点:从"人工规则"转向"数据驱动",系统鲁棒性显著提升
深度学习时代(2011年至今)
年份 里程碑 意义 2013 Word2Vec提出 实现高效词嵌入,开启分布式表示时代 2014 Seq2Seq框架 统一机器翻译、文本生成等序列建模任务 2015 Attention机制 解决长序列依赖,提升模型可解释性 2017 Transformer架构 并行计算+自注意力,奠定大模型基础 2018 BERT预训练 "预训练+微调"范式成为NLP新标准 2022+ 大语言模型(LLM) ChatGPT等推动NLP从"理解"转向"生成"
按历史阶段划分
- 萌芽期(1956年前) :图灵测试、机器翻译构想提出
- 快速发展期(1957-1970) :达特茅斯会议(1956)标志AI诞生,符号主义与统计方法并行探索
- 低谷期(1971-1993) :规则方法瓶颈显现,"人工智能寒冬"影响研究投入
- 复苏融合期(1994至今) :互联网爆发+算力提升+大数据积累,推动NLP与深度学习、大模型深度融合
应用场景
- 语音助手
- 机器翻译
- 搜素引擎
- 智能问答