Skip to content
2026-09-29 04:20706 字NLP基础概念

什么是自然语言处理 ​

自然语言处理(Natural Language Processing, 简称NLP)是计算机科学与语言学中关注于计算机与人类语言间转换的领域,是人工智能与语言学的交叉学科

NLP 就是让计算机理解人类的语言


发展简史 ​

按技术范式划分 ​
  1. 规则驱动时期(1950s-1980s)

    • 1950年:艾伦·图灵提出"图灵测试",奠定NLP理论基础

    • 1954年:乔治城-IBM实验首次实现俄英机器翻译(60余句),但过度乐观的预期导致1966年ALPAC报告后经费大幅削减

    • 1960年代:代表性系统

      • SHRDLU:受限"积木世界"中的对话系统
      • ELIZA:模拟心理治疗的聊天机器人,暴露早期模式匹配的局限性
    • 特点:依赖语言学专家手工编写规则,系统脆弱、泛化能力差

  2. 统计方法兴起(1980s-2010s)

    • 关键转折:摩尔定律提升算力 + 乔姆斯基形式语言学式微 → 机器学习成为主流

    • 技术突破:

      • 隐马尔可夫模型(HMM)用于词性标注
      • 统计机器翻译(IBM主导),利用双语语料库训练概率模型
      • 条件随机场(CRF, 2001)成为序列标注标准方法
    • 特点:从"人工规则"转向"数据驱动",系统鲁棒性显著提升

  3. 深度学习时代(2011年至今)

    年份里程碑意义
    2013Word2Vec提出实现高效词嵌入,开启分布式表示时代
    2014Seq2Seq框架统一机器翻译、文本生成等序列建模任务
    2015Attention机制解决长序列依赖,提升模型可解释性
    2017Transformer架构并行计算+自注意力,奠定大模型基础
    2018BERT预训练"预训练+微调"范式成为NLP新标准
    2022+大语言模型(LLM)ChatGPT等推动NLP从"理解"转向"生成"
按历史阶段划分 ​
  1. 萌芽期(1956年前) :图灵测试、机器翻译构想提出
  2. 快速发展期(1957-1970) :达特茅斯会议(1956)标志AI诞生,符号主义与统计方法并行探索
  3. 低谷期(1971-1993) :规则方法瓶颈显现,"人工智能寒冬"影响研究投入
  4. 复苏融合期(1994至今) :互联网爆发+算力提升+大数据积累,推动NLP与深度学习、大模型深度融合

应用场景 ​

  • 语音助手
  • 机器翻译
  • 搜素引擎
  • 智能问答

‍

每一篇文章,都是时间的标本