:计算机视觉、NLP、语音、多模态,深度学习四大应用域一览)
上一篇文章把地基夯实了:AI 是目标,ML 是手段,DL 是主流实现。但深度学习到底能干什么?答案是——按数据模态分工。人怎么感知世界,AI 就怎么感知世界:用眼睛看(视觉)、用耳朵听(语音)、用嘴巴说(语言)、多感官协同(多模态)。这篇把深度学习的四大应用域一次讲清,每个概念都带定义和例子。目录目录编辑目录一、计算机视觉(CV):让机器看懂世界1.1 图像分类(Image Classification)1.2 目标检测(Object Detection)1.3 语义分割(Semantic Segmentation)1.4 实例分割(Instance Segmentation)1.5 目标跟踪(Object Tracking)1.6 关键点检测(Keypoint Detection)1.7 文字识别(OCR)二、自然语言处理(NLP):让机器读懂语言2.1 自然语言理解(NLU):理解侧2.2 自然语言生成(NLG):生成侧三、语音处理:让机器听懂和开口四、多模态:让机器跨界理解五、机器学习 vs 深度学习:为什么这些应用必须用深度学习六、从每任务一小模型到一大模型通吃七、汇总表 面试官追问7.1 四大应用域汇总7.2 面试官追问(4 个 答案)一、计算机视觉(CV):让机器看懂世界定义:计算机视觉(Computer Vision, CV)是 AI 的核心领域,目标是让机器从图像或视频中提取信息、理解内容并做出决策。CV 有 7 类常见任务,难度逐级递进:1.1 图像分类(Image Classification)定义:给定一张图,从预定义类别中选出最能描述它的标签——识别是什么。例子:判断一张照片是猫还是狗。1.2 目标检测(Object Detection)定义:回答两个问题:图像里有什么(What) 在哪里(Where),用边界框框出每个物体。例子:自动驾驶识别路面上的人、车,并标出位置框。1.3 语义分割(Semantic Segmentation)定义:比目标检测更进一步,给每一个像素都打上类别标签——哪里有什么细化到像素级。例子:把街景图的每个像素标为人/车/天空/道路。1.4 实例分割(Instance Segmentation)定义:语义分割 区分同类不同个体,把每个物体的轮廓精确描绘出来。例子:画面里 3 个马,不仅能标出马,还能区分马A、马B、马C各自的范围。1.5 目标跟踪(Object Tracking)定义:目标检测管单张图,目标跟踪管视频流——在后续帧中持续定位同一目标,建立时序关联。例子:监控视频里持续锁定某个人的位置,知道这一帧的他就是上一帧的他。1.6 关键点检测(Keypoint Detection)定义:不关心轮廓,只找能定义形状的特定坐标点(x, y)。例子:人脸关键点检测(眼睛、鼻子、嘴的位置),用于美颜、表情识别。1.7 文字识别(OCR)定义:光学字符识别(Optical Character Recognition),把图片/扫描件中的文字读出来,转为可编辑文本。例子:手机拍一张名片,自动提取出姓名、电话。二、自然语言处理(NLP):让机器读懂语言定义:自然语言处理(Natural Language Processing, NLP)以文本(离散符号)为核心,研究如何建立人类语言与机器可计算语义之间的映射,让机器能理解并生成语言。NLP 分两大方向:理解(NLU)和生成(NLG)。2.1 自然语言理解(NLU):理解侧文本分类定义:把一段不定长文本,自动打上一个或多个预设类别标签。例子:输入中国乒乓球队夺冠 → 输出[体育];输入央行降息 → 输出[财经]。情感分析定义:文本分类的特殊子集,判断文本背后的主观情绪和态度(正向/负向)。例子:输入手机电池太不耐用了 → 输出 负向。命名实体识别(NER)定义:从非结构化文本中识别出人名、地名、组织、时间等实体。例子:马云在杭州创办了阿里巴巴,时间是1999年 → 马云(人名)/杭州(地名)/阿里巴巴(组织)/1999(时间)。语义相似度定义:计算两段文本在含义层面的相近程度(不是字面重复程度)。例子:如何给手机快速充电 vs 手机快充有哪些技巧 → 相似度极高。这是搜索、问答的核心。2.2 自然语言生成(NLG):生成侧机器翻译定义:把一种语言自动翻译成另一种语言。例子:输入今天天气很好 → 输出The weather is very nice today。对话生成定义:构建能与人多轮交互的聊天机器人。例子:用户问天气,系统反问城市,再给出答案——这就是多轮对话。文章摘要定义:把长文本压缩成含关键信息的短文本。例子:输入几千字新闻,输出5月6日,XX公司发布新款手机,配最新AI芯片,起售价5999元。 现在的 LLM(如 DeepSeek、ChatGPT)已经用预训练提示词的方式,一个模型几乎包揽上面所有 NLP 任务——这正是第五节要讲的。三、语音处理:让机器听懂和开口语音识别(ASR)定义:Automatic Speech Recognition,把语音转成文字。例子:微信语音转文字、会议纪要自动生成、语音输入法。主流架构:Whisper、Paraformer。语音合成(TTS)定义:Text-to-Speech,把文字转成自然语音。例子:导航语音播报、有声书朗读。主流模型:VITS、ChatTTS,已支持少样本克隆人声(几秒样本模仿特定声音)。一句话区别:ASR 是听(声音→文字),TTS 是说(文字→声音)。四、多模态:让机器跨界理解定义:多模态指同时处理、理解或生成两种及以上不同类型数据(模态)。人类天然是多模态的——视觉、听觉、触觉协同理解世界。常见的模态:视觉(图像/视频)、听觉(语音/音乐)、文本(自然语言/代码)、传感器数据。多模态 AI 主要解决三类问题:类型定义例子理解与推理从多种模态中提取含义看图 问题:图中穿红衣服的人在做什么?生成与创作根据一种模态生成另一种文生图(Stable Diffusion)、文生视频(Sora)、文生音乐对齐与检索找到不同模态之间的对应关系输入一只沙滩上的金毛犬,从图库找出匹配图片视觉问答(VQA)是多模态理解的典型:不仅识别物体,还要对整个场景做语义层面解析——综合感知、推理、知识回答关于图像的高阶问题。五、机器学习 vs 深度学习:为什么这些应用必须用深度学习看到这里你可能会问:上面这些任务,传统机器学习也能做吗?答案是能,但几乎做不好。关键差别在特征从哪来。传统机器学习(SVM、决策树等)靠人工特征工程——先由专家手动设计特征(比如词频句长颜色直方图),把原始数据加工成机器能用的数字,再喂给模型。深度学习端到端自动学特征——把原始像素、波形、文本直接扔进去,模型自己逐层抽象出特征(像素→边缘→轮廓→物体)。为什么四大应用域几乎都被深度学习统治?因为图像、语音、文本这类数据,人工设计特征极其困难甚至不可能:应用域传统 ML 的困境深度学习如何解决图像(CV)怎么用数字描述猫?人工设计视觉特征几乎不可行直接吃像素,自动学耳朵、胡须、花纹文本(NLP)词频等统计特征丢语义,苹果是水果还是手机说不清自动学词与词的语义关系(嵌入向量)语音波形、音素人工提取成本高端到端从波形学语音规律多模态各模态难统一处理统一映射到同一向量空间一句话:传统 ML 是人先把特征想好再让机器学,深度学习是机器自己学特征。数据越原始、越复杂,深度学习的优势越碾压——所以图像、语音、自然语言几乎是深度学习的主场。注:深度学习 vs 传统 ML 的完整四维对比(特征提取/可解释性/数据依赖/算力)在系列第(一)篇已详述,本篇只聚焦为什么这些应用必须用 DL这一关键维度。六、从每任务一小模型到一大模型通吃回顾上面所有任务,会发现一个关键转变:过去(深度学习早期):文本分类一个模型、图像识别一个模型、翻译一个模型——每个任务单独训练专用小模型,成本高、不通用。现在(大模型时代):大语言模型(LLM)通过预训练 微调/提示词的方式,几乎能用同一个模型完成以上所有任务。写文章、做翻译、总结文档、看图理解,一个模型通吃。这就是为什么第(一)篇说大模型属于深度学习——它本质是一个海量数据预训练出来的超大深度学习模型,能力从单点任务进化到通用智能。七、汇总表 面试官追问7.1 四大应用域汇总应用域定义代表任务代表例子计算机视觉(CV)让机器从图像/视频提取信息图像分类、目标检测、语义分割、OCR自动驾驶识别行人、名片识别自然语言处理(NLP)让机器理解并生成语言文本分类、情感分析、翻译、对话垃圾邮件判断、机器翻译语音处理让机器处理语音信号ASR(语音转文字)、TTS(文字转语音)微信语音转文字、导航播报多模态同时处理多种数据模态理解推理、生成创作、对齐检索文生图、看图问答7.2 面试官追问(4 个 答案)Q1:CV 和 NLP 最本质的区别是什么?A:输入形态不同。CV 处理的是像素矩阵(连续数值、空间结构强);NLP 处理的是离散符号序列(文本),需要先分词再向量化。这导致两者早期模型架构差异很大。Q2:ASR 和 TTS 有什么区别?A:方向相反。ASR 语音→文字(听),TTS 文字→语音(说)。一个解决机器怎么听懂人,一个解决机器怎么像人一样说话。Q3:为什么现在不用再为每个任务单独训练一个小模型了?A:因为 LLM 用预训练微调/提示词实现了通用能力。预训练让模型掌握了海量语言规律,下游任务只需微调甚至只改提示词就能适配,成本远低于从头训一个专用模型。Q4:多模态模型是怎么对齐不同模态的?A:核心是把不同模态(图像、文本、音频)都映射到同一个向量空间——语义相近的不同模态数据在向量空间里距离近。这样文字描述就能匹配到对应图片,实现跨模态理解。(具体机制后面向量嵌入篇会细讲。)如果这篇帮你理清了深度学习四大应用域,欢迎点赞收藏。评论区聊聊:你最想用 AI 帮你解决哪个场景的问题?