--- title: "04-显卡与 GPU:第二个处理器" aliases: - 显卡与GPU created: 2026-08-29 tags: - 基础与理论 - 计算机速览 --- # 显卡与 GPU:第二个处理器 > 显卡在 [[01-计算机硬件速览|硬件速览]] 里只占"看分辨率"三个字,但 2026 年它是全行业最贵、也最缺的芯片。这篇讲清:为什么 CPU 之外还需要第二个处理器,它凭什么扛起了 AI 时代。 ## 一、CPU 的困境:一类它干不了的活 渲染一帧 1080p 画面 = 1920×1080 ≈ **200 万个像素**,每个像素都走同样的几步小计算,而且**互相不依赖**。CPU 就算 16 核,也是"几个教授挨个做题"——这类活的特征是:**海量、简单、重复、天然并行**。 计算机世界的活分两种口味: | | 串行复杂任务 | 海量并行任务 | | --- | --- | --- | | 例子 | 跑系统、数据库事务、复杂逻辑分支 | 渲染像素、矩阵乘法、图像滤镜 | | 要求 | 低延迟、强控制、大缓存 | 高吞吐、无数个简单单元 | | 适合 | CPU | GPU | ## 二、GPU:数以千计的小学生 **CPU**:少数超强核(教授)——主频高、缓存大、分支预测样样精通,为"快"而生。 **GPU**:数千个瘦小核(小学生)——主频低、逻辑简单,为"多"而生。 > 💡 经典比喻:CPU 是一位数学教授,能解微积分;GPU 是 4000 个只会加减法的小学生。现在出 4000 道加减法题——教授一题一题做,小学生们一人一题**同时**做。没有任何一个通吃,各司其职才是王道。 | | CPU | GPU | | --- | --- | --- | | 核心数 | 4~128(强核) | 数千~上万(瘦核) | | 主频 | 高(4~6GHz) | 较低 | | 缓存/控制逻辑 | 大而复杂 | 砍到最小 | | 擅长 | 串行、分支多、低延迟 | 并行、吞吐量 | | 编程方式 | 通用 | 并行框架(CUDA 等) | 两者其实一直在互相渗透:CPU 里塞了几十个 SIMD 小单元做向量运算,GPU 里也留了几个"聪明核"做调度——但分工的大格局没变。 ## 三、一块显卡里有什么 **GPU 芯片 + 显存(VRAM)+ 供电 + 散热**,三个容易混的点: - **显存不是内存**。GDDR6/HBM 显存焊在显卡板上,带宽几百 GB/s 起、数据中心卡 1TB/s+——是普通内存(几十 GB/s)的十倍以上。GPU 吃数据的量像消防栓,普通内存那根管子不够粗。 - **核显 vs 独显**。核显 = GPU 焊进 CPU,**共享内存**(省电省空间,性能一般);独显 = 独立板卡 + 专用显存(性能强、耗电大)。轻薄本配核显、游戏本加独显,本质是功耗与性能的取舍。 - **功耗与散热不是玄学**。独显动辄两三百瓦,机箱风道、供电余量都是真实约束——笔记本里还有"功耗墙":同一型号 GPU,笔记本版可能比台式版弱 30%。 ## 四、从游戏到 AI:一场翻身仗 1. **游戏时代**(1990s 起):GPU 生来就是渲染管线的专用电路,干的是天生的老本行 2. **通用化**(2007):NVIDIA 推出 **CUDA**,程序员第一次能用类 C 语言把**任意并行问题**扔给 GPU——它不再只是"画图的" 3. **挖矿插曲**(2013–2022):哈希计算也是海量并行 → 显卡被抢空三年,一句话历史 4. **AI 主场**(2016–今):神经网络训练的本质是**矩阵乘法**——亿级别的乘加运算,天然并行,简直是为 GPU 量身定做。2012 年 AlexNet 用两块游戏显卡拿下 ImageNet,深度学习革命从这把火烧起;到 2026 年,训练大模型要几万张卡互联跑数周 5. **第三种处理器**:手机和 Apple 芯片里还长出了 **NPU**(神经处理单元)——比 GPU 更专用的推理电路,牺牲通用性换能效。手机相册能搜"猫"、输入法能离线联想,都是它在跑 > 🤔 所以"AI 算力"为什么贵?训练一次大模型 = 万亿级乘加运算,只能靠几万块 GPU 组网硬算。挖矿时代你听说过的"缺卡",AI 时代升级成了"缺整个数据中心"。 ## 五、买显卡看什么 | 看什么 | 为什么 | | --- | --- | | 显存大小 | AI 推理、高分辨率游戏最先爆的就是它 | | 架构代数 | 新架构同功耗性能强得多,比"显存大"更重要 | | AI 算力(TOPS)/ CUDA 生态 | 2026 年选卡先看 AI 性能和软件栈 | | 功耗与散热 | 性能释放的上限;笔记本看功耗墙 | ## 六、盲点自测 1. **什么样的活适合 GPU?** ——海量、简单、重复、互相不依赖的并行计算(像素、矩阵、哈希);反之强逻辑、多分支的活 CPU 干。 2. **GPU 核心为什么"瘦"?** ——砍掉分支预测、大缓存这些控制逻辑,晶体管全换成计算单元——赌你用不上它们。 3. **显存和内存什么关系?** ——两套独立系统。显存带宽高一个量级,因为 GPU 的数据吞吐远超 CPU。 4. **核显和独显的本质区别?** ——是否独占显存与供电:核显借内存(管细),独显自带宽管。 5. **深度学习为什么偏爱 GPU?** ——训练 = 矩阵乘法 = 海量并行乘加,正是 GPU 的主场。 6. **NPU 和 GPU 差在哪?** ——NPU 更专用(推理优化、低功耗),牺牲通用性换能效,跑在手机/笔记本本地。 ## 七、动手玩一把 ```bash # macOS(Apple 芯片):看 GPU 核心数与型号 system_profiler SPDisplaysDataType | grep -iE "cores|chipset" # Linux(N 卡):实时占用、显存、温度 nvidia-smi # Linux:找显卡型号 lspci | grep -i vga ``` --- 硬件的戏份到这就齐了。收尾来个轻松的:超市收银台那个黑白格子,是怎么把信息装进图案里的?→ [[05-关于二维码]] ⬅️ [[03-总线与接口|总线与接口]] 🏠 [[00-基础与理论|00-基础与理论]] ➡️ [[05-关于二维码|关于二维码]]