2026-05-28
我们平时使用AI时,往往只看到最终的结果。
比如输入一句话,大模型生成一段回答;上传一张图片,AI可以识别里面的内容;输入一段描述,AI可以生成图片。
但在这些功能背后,AI并不是“凭空运行”的。一个AI系统想要完成训练和推理,通常需要硬件提供计算能力,也需要软件工具帮助开发者搭建、训练和部署模型。
简单来说,AI想要真正运行起来,离不开两部分:硬件负责提供算力,软件负责帮助模型开发和运行。
普通计算机也可以进行计算,但AI模型需要处理的数据量往往非常大。
尤其是在深度学习和大模型训练中,系统需要反复进行大量矩阵和向量运算,同时不断调整模型参数。
如果只依赖普通计算方式,训练速度可能非常慢。
因此,AI领域会使用不同类型的计算芯片来提升效率,其中最常见的包括CPU、GPU、TPU和NPU。
这些芯片并不是谁一定比谁“更高级”,而是擅长处理的任务不同。
CPU,也就是中央处理器,是计算机中最常见的核心处理器。
它的特点是通用性强,能够处理各种不同类型的任务,比如运行操作系统、打开软件、处理程序逻辑等。
可以把CPU理解成一个能力比较全面的“管理者”。
它可以处理很多复杂任务,但同时能够并行处理的计算数量相对有限。
在AI系统中,CPU仍然非常重要,例如负责数据处理、程序调度、系统控制等任务。但如果面对大规模深度学习计算,仅靠CPU往往效率不够高。
这时候,就需要更加擅长并行计算的GPU。
GPU原本主要用于图形处理,比如游戏画面和图像渲染。
后来人们发现,GPU拥有大量计算单元,可以同时进行许多相似的计算任务,而深度学习恰好需要大量重复的并行计算。
因此,GPU逐渐成为AI模型训练和推理的重要硬件之一。
可以做一个简单的类比。
如果现在有1000道类似的数学题需要计算,CPU更像几个能力很强的人,可以处理不同类型的复杂问题;GPU则像同时安排很多人一起计算,每个人负责其中一部分。
面对大量重复计算时,GPU的效率通常会更高。
这也是为什么我们经常听到“训练大模型需要大量GPU”。
简单来说,GPU特别适合:
深度学习训练、模型推理、图像处理以及大规模并行计算。
TPU,全称是Tensor Processing Unit,也就是张量处理器。
它是针对机器学习和深度学习中的张量运算专门设计的处理器。
“张量”这个词对于初学者可能比较陌生,可以简单理解为AI模型经常需要处理的一种多维数据形式。
因为深度学习中会大量使用这类计算,所以专门针对这些任务优化的芯片,可以进一步提高计算效率。
TPU主要用于机器学习和深度学习相关任务,可以理解为一种“专门为AI计算设计的工具”。
如果说CPU追求的是通用性,GPU擅长大规模并行计算,那么TPU更强调对特定AI计算任务进行优化。
NPU,全称是Neural Processing Unit,也就是神经网络处理器。
它主要针对神经网络计算进行优化。
神经网络模型在运行过程中,会涉及卷积、矩阵运算等大量计算任务,NPU可以通过专门的硬件设计,提高这些任务的执行效率。
NPU现在也经常出现在手机、智能设备和AI服务器等场景中。
比如,一些手机中的AI功能可能会使用NPU完成图像识别、语音处理等任务。
因此,NPU可以简单理解为:
专门为神经网络计算设计的AI加速芯片。
对于初学者来说,不需要记住复杂的硬件结构,只需要先理解它们各自的定位。
CPU的特点是通用,适合处理各种计算任务。
GPU擅长大规模并行计算,因此广泛应用于深度学习训练和推理。
TPU针对机器学习中的张量运算进行了专门优化。
NPU则主要针对神经网络相关计算进行加速。
可以简单记成一句话:
CPU负责“综合处理”,GPU擅长“同时算很多”,TPU和NPU则更偏向专门的AI计算任务。
只有硬件还不能直接完成AI模型开发。
开发者还需要使用软件工具来搭建模型、训练模型和部署模型。
这时候就需要深度学习框架。
深度学习框架可以理解为AI开发者使用的“工具箱”。
它已经封装好了大量常用功能,开发者不需要从最底层开始编写所有计算过程,而是可以直接调用已有工具完成模型开发。
目前常见的深度学习框架包括TensorFlow和PyTorch。
TensorFlow可以用于模型开发、训练和部署。
PyTorch同样被广泛用于深度学习开发,它的开发和调试方式相对灵活,因此在科研和模型开发中较为常见。
对于初学者来说,不需要马上掌握这些框架的具体代码,只需要知道:
AI模型的开发通常不是直接操作芯片,而是通过开发框架来完成。
除了深度学习框架,现在AI开发还形成了很多模型和工具生态。
Hugging Face就是其中比较常见的AI开源生态之一。
它提供了大量预训练模型和相关工具。
例如,Transformers库可以帮助开发者调用各种自然语言处理和大模型;Diffusers库常用于扩散模型相关的图像生成任务;此外,还有用于模型微调、应用部署和智能体开发的相关工具。
ModelScope则是一个AI模型和工具平台,提供自然语言处理、计算机视觉、语音、多模态等不同领域的模型和工具资源。
可以简单理解为:
TensorFlow和PyTorch更像“开发AI模型的工具箱”,而Hugging Face、ModelScope等平台则进一步提供了大量现成的模型和配套工具。
开发者可以在这些基础上继续开发,而不需要所有模型都从零开始训练。
现在可以把前面的内容串起来看。
一个AI应用背后,通常会涉及多个环节。
首先需要CPU、GPU、TPU或NPU等硬件提供计算能力。
然后通过TensorFlow、PyTorch等开发框架搭建和训练模型。
开发者还可以借助Hugging Face、ModelScope等生态中的预训练模型和工具,提高开发效率。
最终,模型被部署到实际系统中,用户才能使用AI问答、图像生成、语音识别等功能。
所以,一个AI应用的背后,并不只是“一个模型”。
它往往是由算力芯片、开发框架、模型和应用系统共同组成的。
今天最需要记住的是:
硬件负责提供算力,软件负责帮助开发和运行模型。
CPU适合通用计算,GPU擅长大规模并行计算,TPU主要针对张量运算进行优化,NPU主要用于加速神经网络计算。
TensorFlow和PyTorch属于常见的深度学习开发框架,而Hugging Face、ModelScope则提供了丰富的模型和工具生态。
可以用一句话快速记忆:
芯片负责“算”,框架负责“开发”,模型负责“实现智能”。
为什么训练深度学习模型时经常使用GPU,而不是只使用CPU?
答案是:因为深度学习需要进行大量重复的并行计算,而GPU拥有较强的大规模并行计算能力,因此在这类任务中通常效率更高。
下一期「每日AI学习」,我们将进入人工智能安全相关内容:使用AI时,为什么需要特别注意隐私保护?
完 谢谢观看
