中国工程院院士郑纬民:做好模型推理要掌握四大关键
【导语】7月27日,上海举办了世界人工智能大会的一个分论坛,聚焦“芯节点·新突破——协同创新聚力 加速智算破局”主题。中国工程院院士、清华大学计算机系教授郑纬民在会上发表了重要演讲,深入剖析了人工智能产业竞争的关键——大模型推理引擎。他指出,要提升模型推理能力,必须掌握算子优化、模型量化、异构调度和并行优化四大关键点。这些关键技术的突破,将为人工智能的未来发展注入强劲动力。
7月27日,世界人工智能大会分论坛“芯节点·新突破——协同创新聚力 加速智算破局”主题论坛在上海举行。中国工程院院士、清华大学计算机系教授郑纬民会上发表演讲。他表示,大模型推理引擎是人工智能产业竞争的关键,做好模型推理需要掌握好算子优化、模型量化、异构调度、并行优化四大关键点。

关键点一:算子优化
算子优化就是对大模型中的单个算子(如Conv卷积(jī)、MatMu矩(ju)阵(zhèn)乘(chéng)法(fǎ)等(děng))做(zuò)性(xìng)能(néng)改(gǎi)造(zào),使(shǐ)同(tóng)一(yī)个(gè)算(suàn)子(zi)在(zài)给定硬件上跑得更快、占用内存更少、功耗更低。例如,将“卷积”这个算子从普通C语言替换为汇编级Winograd+SIMD+缓存分块,就是一次算子优化(huà)。
算(suàn)子(zi)优(yōu)化(huà)主要有两种实现方案:其一,图层优化,包括不等价交换,用可控误差换性能;基于表达式交换,用代数/符号规则在图层级(jí)别(bié)做(zuò)等(děng)价(jià)化(huà)简(jiǎn);张(zhāng)量(liàng)属(shǔ)性(xìng)变(biàn)换(huàn),通(tōng)过(guò)调整张量的形状、步长等消除冗余内存搬移或者提高并行度等。其二,算子层优化,即采用计算访存重叠、异步流水调度等技术进行算子优化。
关键点二:模型量化
模型量化就是将模型中的浮点参数(如32位FP32)转换(huàn)为(wèi)低(dī)比(bǐ)特(tè)整(zhěng)数(shù)(如(rú)8位(wèi)INT8)的(de)技(jì)术(shù),目(mù)的(de)是(shì)缩(suō)减(jiǎn)模(mó)型(xíng)体(tǐ)量(liàng)、降(jiàng)低(dī)计(jì)算(suàn)量(liàng)、提(tí)升(shēng)推(tuī)理(lǐ)速(sù)度(dù),同(tóng)时(shí)尽(jǐn)量(liàng)保(bǎo)持(chí)模(mó)型(xíng)精(jīng)度(dù)。在(zài)模(mó)型(xíng)规(guī)模(mó)急(jí)剧(jù)增(zēng)加、低精度计算单元越来越多样(yàng)的(de)背(bèi)景(jǐng)下(xià),模(mó)型(xíng)量(liàng)化(huà)是(shì)减(jiǎn)少(shǎo)内(nèi)存(cún)需(xū)求(qiú)和(hé)提(tí)升(shēng)推(tuī)理(lǐ)性(xìng)能(néng)的(de)有(yǒu)效(xiào)途(tú)径。
当(dāng)前(qián)模(mó)型(xíng)量(liàng)化(huà)主要(yào)有(yǒu)两(liǎng)种(zhǒng)方(fāng)案(àn):
其(qí)一(yī),单(dān)一(yī)精(jīng)度(dù)量(liàng)化(huà),直接将模型中的高位宽参数替换为低比特,例如将16位浮点数直接替换为8位整数,这一方式以“极简部署”换“精度弹性”,在硬件支持单一格式或对精度不敏感时是首选。
其二,混合精度量化,在同一网络里按层、张量或通道分别使用两种及以上位宽(如INT8+FP16、INT4+INT8、FP8+FP16+FP32等),而不是“一刀切”成单一低比特。
但混合精度推理的发展也面临着挑战,混合精度库开发周期长,历时超过一年;代码量大,超过1万行;算子性能差,相较于单一精度推理,性能下降70%。导致现有的混合精度推理利用率仍较低。
关键点三:异构调度
异构调度指在包含多种不同类型计算单元(CPU、GPU、FPGA、AI加速器等)系统中,将任务或子任务动态、合理地分配到最合适的处理器上,同时满足性能、功耗、资源利用率或实时性等多重目标的一种资源管理技术。该技术的目标是让正确的任务在正确的时间跑到正确的芯片上,例如将“跑得快但耗电高”的GPU留给矩阵乘法,把“省电但慢”的CPU小核留给控制逻辑。
模型推理可大致分为两个过程:一是P过程(prefill,预填充),二是D过程(decode,解码)。前者预处理负载请求的所有token,读取并“理解”用户输入的上下文,这一过程是计算密集型的;D过程则是和访存密集相关。
P过程与D过程所需的负载不同,如果能将P过程和D过程拆成两个独立的流水线,分别在不同的硬件上跑,且能实现互不干扰,推理计算的整体性能就提高了。
关键点四:并行优化
并行优化即把深度学习任务拆成多条独立或半独立的计算通路,让他们在同一个时刻被多个计算单元并行执行,从而在“时间”或“空间”维度上换取整体吞吐或延迟提升的一系列工程手段(duàn)。简(jiǎn)单(dān)理(lǐ)解(jiě),这(zhè)就(jiù)相(xiāng)当(dāng)于(yú)“把(bǎ)1个(gè)人(rén)干(gàn)100天(tiān)的(de)活(huó),拆(chāi)成(chéng)100个(gè)人(rén)1天(tiān)干(gàn)完(wán)”。
当(dāng)前(qián),并(bìng)行(xíng)优(yōu)化(huà)面(miàn)临(lín)着(zhe)两(liǎng)大(dà)挑(tiāo)战(zhàn):
其(qí)一(yī),由(yóu)于(yú)推(tuī)理(lǐ)场(chǎng)景(jǐng)多(duō)样(yàng)化(huà),且(qiě)不(bù)同(tóng)推(tuī)理(lǐ)场(chǎng)景的负载模式不同,固定的并行策略无法适应动态推理场景。例如,科研论文摘要、财报分析等,输入内容长,则Prefill占优,属于计算密集型任务;深度思考,输出文本长,则Decode占优,属于(yú)访(fǎng)存(cún)密(mì)集型(xíng)。针(zhēn)对(duì)这(zhè)些(xiē)不(bù)同(tóng)的(de)应(yīng)用(yòng)场(chǎng)景(jǐng),需(xū)要(yào)制(zhì)定(dìng)不同的并行策略。
其二,由于大模型服务场景存在明显的潮汐特性,不同时段的系统压力不同,静态的推理系统也无法适应动态服务场景。具体来看,白天时段使用人数多,请求量大,系统压力大,存在显存缺口;凌晨时段使用人数少,请求数量小,系统压力小,存在显存空闲。
因此需要采用动态的并行策略,通过并行策略自动调整减少算力浪费。例如,在请求较多时,采用(yòng)张(zhāng)量(liàng)并(bìng)行(xíng)+流(liú)水线并行的策略,吞吐量更大;在请求较少时,Attention(注意力机制模型)部分采用数据并行,MoE(混合专家模型)部分采用专家并行策(cè)略(è)的(de)吞(tūn)吐(tǔ)量(liàng)更(gèng)高(gāo)。