显卡与 GPU:第二个处理器
显卡在 硬件速览 里只占"看分辨率"三个字,但 2026 年它是全行业最贵、也最缺的芯片。这篇讲清:为什么 CPU 之外还需要第二个处理器,它凭什么扛起了 AI 时代。
一、CPU 的困境:一类它干不了的活
渲染一帧 1080p 画面 = 1920×1080 ≈ 200 万个像素,每个像素都走同样的几步小计算,而且互相不依赖。CPU 就算 16 核,也是"几个教授挨个做题"——这类活的特征是:海量、简单、重复、天然并行。
计算机世界的活分两种口味:
| 串行复杂任务 | 海量并行任务 | |
|---|---|---|
| 例子 | 跑系统、数据库事务、复杂逻辑分支 | 渲染像素、矩阵乘法、图像滤镜 |
| 要求 | 低延迟、强控制、大缓存 | 高吞吐、无数个简单单元 |
| 适合 | CPU | GPU |
二、GPU:数以千计的小学生
CPU:少数超强核(教授)——主频高、缓存大、分支预测样样精通,为"快"而生。 GPU:数千个瘦小核(小学生)——主频低、逻辑简单,为"多"而生。
💡 经典比喻:CPU 是一位数学教授,能解微积分;GPU 是 4000 个只会加减法的小学生。现在出 4000 道加减法题——教授一题一题做,小学生们一人一题同时做。没有任何一个通吃,各司其职才是王道。
| CPU | GPU | |
|---|---|---|
| 核心数 | 4~128(强核) | 数千~上万(瘦核) |
| 主频 | 高(4~6GHz) | 较低 |
| 缓存/控制逻辑 | 大而复杂 | 砍到最小 |
| 擅长 | 串行、分支多、低延迟 | 并行、吞吐量 |
| 编程方式 | 通用 | 并行框架(CUDA 等) |
两者其实一直在互相渗透:CPU 里塞了几十个 SIMD 小单元做向量运算,GPU 里也留了几个"聪明核"做调度——但分工的大格局没变。
三、一块显卡里有什么
GPU 芯片 + 显存(VRAM)+ 供电 + 散热,三个容易混的点:
- 显存不是内存。GDDR6/HBM 显存焊在显卡板上,带宽几百 GB/s 起、数据中心卡 1TB/s+——是普通内存(几十 GB/s)的十倍以上。GPU 吃数据的量像消防栓,普通内存那根管子不够粗。
- 核显 vs 独显。核显 = GPU 焊进 CPU,共享内存(省电省空间,性能一般);独显 = 独立板卡 + 专用显存(性能强、耗电大)。轻薄本配核显、游戏本加独显,本质是功耗与性能的取舍。
- 功耗与散热不是玄学。独显动辄两三百瓦,机箱风道、供电余量都是真实约束——笔记本里还有"功耗墙":同一型号 GPU,笔记本版可能比台式版弱 30%。
四、从游戏到 AI:一场翻身仗
- 游戏时代(1990s 起):GPU 生来就是渲染管线的专用电路,干的是天生的老本行
- 通用化(2007):NVIDIA 推出 CUDA,程序员第一次能用类 C 语言把任意并行问题扔给 GPU——它不再只是"画图的"
- 挖矿插曲(2013–2022):哈希计算也是海量并行 → 显卡被抢空三年,一句话历史
- AI 主场(2016–今):神经网络训练的本质是矩阵乘法——亿级别的乘加运算,天然并行,简直是为 GPU 量身定做。2012 年 AlexNet 用两块游戏显卡拿下 ImageNet,深度学习革命从这把火烧起;到 2026 年,训练大模型要几万张卡互联跑数周
- 第三种处理器:手机和 Apple 芯片里还长出了 NPU(神经处理单元)——比 GPU 更专用的推理电路,牺牲通用性换能效。手机相册能搜"猫"、输入法能离线联想,都是它在跑
🤔 所以"AI 算力"为什么贵?训练一次大模型 = 万亿级乘加运算,只能靠几万块 GPU 组网硬算。挖矿时代你听说过的"缺卡",AI 时代升级成了"缺整个数据中心"。
五、买显卡看什么
| 看什么 | 为什么 |
|---|---|
| 显存大小 | AI 推理、高分辨率游戏最先爆的就是它 |
| 架构代数 | 新架构同功耗性能强得多,比"显存大"更重要 |
| AI 算力(TOPS)/ CUDA 生态 | 2026 年选卡先看 AI 性能和软件栈 |
| 功耗与散热 | 性能释放的上限;笔记本看功耗墙 |
六、盲点自测
- 什么样的活适合 GPU? ——海量、简单、重复、互相不依赖的并行计算(像素、矩阵、哈希);反之强逻辑、多分支的活 CPU 干。
- GPU 核心为什么"瘦"? ——砍掉分支预测、大缓存这些控制逻辑,晶体管全换成计算单元——赌你用不上它们。
- 显存和内存什么关系? ——两套独立系统。显存带宽高一个量级,因为 GPU 的数据吞吐远超 CPU。
- 核显和独显的本质区别? ——是否独占显存与供电:核显借内存(管细),独显自带宽管。
- 深度学习为什么偏爱 GPU? ——训练 = 矩阵乘法 = 海量并行乘加,正是 GPU 的主场。
- NPU 和 GPU 差在哪? ——NPU 更专用(推理优化、低功耗),牺牲通用性换能效,跑在手机/笔记本本地。
七、动手玩一把
# macOS(Apple 芯片):看 GPU 核心数与型号
system_profiler SPDisplaysDataType | grep -iE "cores|chipset"
# Linux(N 卡):实时占用、显存、温度
nvidia-smi
# Linux:找显卡型号
lspci | grep -i vga
硬件的戏份到这就齐了。收尾来个轻松的:超市收银台那个黑白格子,是怎么把信息装进图案里的?→ 05-关于二维码
💬 评论