【CAIE一级教材】每日AI学习03|AI运行需要什么?一篇看懂GPU、TPU、NPU和开发框架

2026-05-28

我们平时使用AI时,往往只看到最终的结果。

比如输入一句话,大模型生成一段回答;上传一张图片,AI可以识别里面的内容;输入一段描述,AI可以生成图片。

但在这些功能背后,AI并不是凭空运行的。一个AI系统想要完成训练和推理,通常需要硬件提供计算能力,也需要软件工具帮助开发者搭建、训练和部署模型。

简单来说,AI想要真正运行起来,离不开两部分:硬件负责提供算力,软件负责帮助模型开发和运行。

一、为什么AI需要专门的算力?

普通计算机也可以进行计算,但AI模型需要处理的数据量往往非常大。

尤其是在深度学习和大模型训练中,系统需要反复进行大量矩阵和向量运算,同时不断调整模型参数。

如果只依赖普通计算方式,训练速度可能非常慢。

因此,AI领域会使用不同类型的计算芯片来提升效率,其中最常见的包括CPUGPUTPUNPU

这些芯片并不是谁一定比谁更高级,而是擅长处理的任务不同。

二、CPU:计算机里的“综合管理者”

CPU,也就是中央处理器,是计算机中最常见的核心处理器。

它的特点是通用性强,能够处理各种不同类型的任务,比如运行操作系统、打开软件、处理程序逻辑等。

可以把CPU理解成一个能力比较全面的管理者

它可以处理很多复杂任务,但同时能够并行处理的计算数量相对有限。

AI系统中,CPU仍然非常重要,例如负责数据处理、程序调度、系统控制等任务。但如果面对大规模深度学习计算,仅靠CPU往往效率不够高。

这时候,就需要更加擅长并行计算的GPU

三、GPU:为什么AI训练经常使用它?

GPU原本主要用于图形处理,比如游戏画面和图像渲染。

后来人们发现,GPU拥有大量计算单元,可以同时进行许多相似的计算任务,而深度学习恰好需要大量重复的并行计算。

因此,GPU逐渐成为AI模型训练和推理的重要硬件之一。

可以做一个简单的类比。

如果现在有1000道类似的数学题需要计算,CPU更像几个能力很强的人,可以处理不同类型的复杂问题;GPU则像同时安排很多人一起计算,每个人负责其中一部分。

面对大量重复计算时,GPU的效率通常会更高。

这也是为什么我们经常听到训练大模型需要大量GPU”

简单来说,GPU特别适合:

深度学习训练、模型推理、图像处理以及大规模并行计算。

四、TPU:为AI计算专门设计的芯片

TPU,全称是Tensor Processing Unit,也就是张量处理器。

它是针对机器学习和深度学习中的张量运算专门设计的处理器。

张量这个词对于初学者可能比较陌生,可以简单理解为AI模型经常需要处理的一种多维数据形式。

因为深度学习中会大量使用这类计算,所以专门针对这些任务优化的芯片,可以进一步提高计算效率。

TPU主要用于机器学习和深度学习相关任务,可以理解为一种专门为AI计算设计的工具

如果说CPU追求的是通用性,GPU擅长大规模并行计算,那么TPU更强调对特定AI计算任务进行优化。

五、NPU:专门处理神经网络任务

NPU,全称是Neural Processing Unit,也就是神经网络处理器。

它主要针对神经网络计算进行优化。

神经网络模型在运行过程中,会涉及卷积、矩阵运算等大量计算任务,NPU可以通过专门的硬件设计,提高这些任务的执行效率。

NPU现在也经常出现在手机、智能设备和AI服务器等场景中。

比如,一些手机中的AI功能可能会使用NPU完成图像识别、语音处理等任务。

因此,NPU可以简单理解为:

专门为神经网络计算设计的AI加速芯片。

六、CPU、GPU、TPU、NPU怎么区分?

对于初学者来说,不需要记住复杂的硬件结构,只需要先理解它们各自的定位。

CPU的特点是通用,适合处理各种计算任务。

GPU擅长大规模并行计算,因此广泛应用于深度学习训练和推理。

TPU针对机器学习中的张量运算进行了专门优化。

NPU则主要针对神经网络相关计算进行加速。

可以简单记成一句话:

CPU负责综合处理GPU擅长同时算很多TPUNPU则更偏向专门的AI计算任务。

七、有了硬件,为什么还需要开发框架?

只有硬件还不能直接完成AI模型开发。

开发者还需要使用软件工具来搭建模型、训练模型和部署模型。

这时候就需要深度学习框架。

深度学习框架可以理解为AI开发者使用的工具箱

它已经封装好了大量常用功能,开发者不需要从最底层开始编写所有计算过程,而是可以直接调用已有工具完成模型开发。

目前常见的深度学习框架包括TensorFlowPyTorch

TensorFlow可以用于模型开发、训练和部署。

PyTorch同样被广泛用于深度学习开发,它的开发和调试方式相对灵活,因此在科研和模型开发中较为常见。

对于初学者来说,不需要马上掌握这些框架的具体代码,只需要知道:

AI模型的开发通常不是直接操作芯片,而是通过开发框架来完成。

八、Hugging Face和ModelScope又是什么?

除了深度学习框架,现在AI开发还形成了很多模型和工具生态。

Hugging Face就是其中比较常见的AI开源生态之一。

它提供了大量预训练模型和相关工具。

例如,Transformers库可以帮助开发者调用各种自然语言处理和大模型;Diffusers库常用于扩散模型相关的图像生成任务;此外,还有用于模型微调、应用部署和智能体开发的相关工具。

ModelScope则是一个AI模型和工具平台,提供自然语言处理、计算机视觉、语音、多模态等不同领域的模型和工具资源。

可以简单理解为:

TensorFlowPyTorch更像开发AI模型的工具箱,而Hugging FaceModelScope等平台则进一步提供了大量现成的模型和配套工具。

开发者可以在这些基础上继续开发,而不需要所有模型都从零开始训练。

九、一个AI系统是怎么运行起来的?

现在可以把前面的内容串起来看。

一个AI应用背后,通常会涉及多个环节。

首先需要CPUGPUTPUNPU等硬件提供计算能力。

然后通过TensorFlowPyTorch等开发框架搭建和训练模型。

开发者还可以借助Hugging FaceModelScope等生态中的预训练模型和工具,提高开发效率。

最终,模型被部署到实际系统中,用户才能使用AI问答、图像生成、语音识别等功能。

所以,一个AI应用的背后,并不只是一个模型

它往往是由算力芯片、开发框架、模型和应用系统共同组成的。

今日知识总结

今天最需要记住的是:

硬件负责提供算力,软件负责帮助开发和运行模型。

CPU适合通用计算,GPU擅长大规模并行计算,TPU主要针对张量运算进行优化,NPU主要用于加速神经网络计算。

TensorFlowPyTorch属于常见的深度学习开发框架,而Hugging FaceModelScope则提供了丰富的模型和工具生态。

可以用一句话快速记忆:

芯片负责,框架负责开发,模型负责实现智能

 

今日小测试

为什么训练深度学习模型时经常使用GPU,而不是只使用CPU

答案是:因为深度学习需要进行大量重复的并行计算,而GPU拥有较强的大规模并行计算能力,因此在这类任务中通常效率更高。

下一期「每日AI学习」,我们将进入人工智能安全相关内容:使用AI时,为什么需要特别注意隐私保护?

 

完 谢谢观看

确定要退出登录吗?
确定 取消