多尺度注意力人群密度估计模型研究

Download PDF
栾方军,  田雨晴*,  袁帅

沈阳建筑大学, 计算机科学与工程学院, 辽宁沈阳 110168

摘     要: 针对密集人群图像中目标尺度变化大、背景干扰强等问题,本文提出一种基于多尺度选择性密度聚合网络(MSDA-Net)的人群计数模型。该模型引入了三个协同模块:多尺度调制模块(MTM)、选择性注意力模块(SAM)和密度上下文感知模块(DCF),三者共同增强特征表达能力和密度图质量,从而提高拥挤复杂场景下的计数精度。具体而言,MTM模块通过多分支空洞卷积捕获不同尺度的上下文信息,缓解目标尺度剧烈变化带来的影响;SAM模块利用空间与通道注意力机制抑制背景噪声,突出前景人群区域;DCF模块采用卷积长短时记忆网络对密度图的上下文依赖关系进行建模,增强相邻区域间的连续性,以生成更平滑、准确的密度图。实验中采用了联合损失函数,结合了欧氏距离损失与结构相似性(SSIM)损失,同时优化像素级回归和局部结构一致性。在四个公开数据集上进行了充分验证,包括ShanghaiTech Part_A、ShanghaiTech Part_B、UCF_CC_50和UCF_QNRF。所提出的MSDA-Net在所有数据集上均取得了优异性能,例如在Part_A上MAE为58.1,Part_B上为6.9,UCF_CC_50上为205.3,UCF_QNRF上为84.8,超过了多种最先进的方法。消融实验进一步验证了每个模块的单独贡献。总体而言,MSDA-Net在真实拥挤场景中表现出强大的泛化能力和实际应用价值。
关 键 词: 密集人群计数; 多尺度调制; 注意力机制; 上下文建模; MSDA-Net
DOI: 10.57237/j.cst.2026.03.001
联系咨询

欢迎添加编辑微信,
了解期刊信息及投稿要求:

微信:18601600891(手机同号)

加入编委会

诚邀优秀学者加入期刊的编委会,共同推动学术成果的传播,并引领科研的发展方向。

加入编委会
成为审稿人

诚邀对审稿工作有浓厚兴趣的学者加入我们的审稿人团队,共同确保期刊的学术质量,展示高水平的科研成果。

成为审稿人