随机权重平均(SWA)是一种增强深度学习模型泛化能力的技术。与传统SGD收敛到单一局部最小值不同,它通过在训练后期平均多个时期的权重,利用最小值周围的权重多样性,形成更稳健的权重集。SWA能减少过拟合,在图像分类、自然语言处理等任务中较标准SGD提升1-5%准确率,且计算开销小,仅需存储和更新平均权重。实现时,先训练基础模型至稳定,再定期平均权重用于推理。其广泛应用于计算机视觉(如CNN、Vision Transformers)、NLP(如BERT、LSTM)及迁移学习,是科研和工业中提升模型可靠性的实用...