Toggle navigation
计算机科学
首页
关于本刊
期刊介绍
学术指标
学术荣誉
编委会
道德声明
OA政策
缴费&订阅
联系我们
English
1974年1月创刊(月刊)
主管/主办:重庆西南信息有限公司
ISSN 1002-137X
CN 50-1075/TP
CODEN JKIEBK
作者中心
投稿/查询
投稿模板
处理流程
投稿指南
审稿中心
编委登录
审稿登录
审稿专家申请
审稿要求/审稿单
编辑中心
编辑登录
图像处理&多媒体技术 栏目所有文章列表
(按年度、期号倒序)
一年内发表的文章
|
两年内
|
三年内
|
全部
Please wait a minute...
选择:
导出引用
EndNote
Ris
BibTeX
显示/隐藏图片
Select
1.
基于标签松弛多视角特征融合的糖尿病视网膜病变分级
段练
计算机科学 2026, 53 (
6A
): 250200048-6. DOI:
10.11896/jsjkx.250200048
摘要
(
58
)
PDF(pc)
(3298KB)(
41
)
可视化
收藏
糖尿病视网膜病变是糖尿病较为常见的并发症,准确识别糖尿病视网膜病变等级对后续治疗非常关键。眼底图像在糖尿病视网膜病变分级中发挥着关键作用。随着人工智能技术的发展,许多研究者已经从眼底图像中提取深度特征和放射组学特征开展糖尿病视网膜病变分级研究。结合深度特征和放射组学特征,设计了一种特征融合算法。首先,利用卷积神经网络从眼底图像中提取深度特征,并使用放射组学方法提取放射组学特征。随后,设计了一种基于标签松弛的多视角学习算法进行特征融合。标签松弛的主要目标是增强标签空间中训练样本的可区分性,从而提高模型的分类准确率。此外,还引入了基于流形学习方法的图约束,以减轻标签松弛所导致的过拟合问题。最后,在DR1和MESSIDOR两个眼底图像数据集上验证了所提出方法的有效性。
参考文献
|
相关文章
|
多维度评价
Select
2.
时变非高斯观测噪声下雷达目标跟踪改进方法
杨翰琨, 朱博威, 王作帅, 徐以东
计算机科学 2026, 53 (
6A
): 250300058-7. DOI:
10.11896/jsjkx.250300058
摘要
(
51
)
PDF(pc)
(3761KB)(
46
)
可视化
收藏
文中提出了一种改进的最小误差熵卡尔曼滤波算法,旨在应对复杂的时变非高斯观测噪声环境中的雷达目标跟踪问题。该算法通过引入自适应噪声协方差调整策略和观测数据平滑处理技术,能够有效地动态适应海面噪声特性。通过仿真实验,在时变厚尾噪声环境下,改进算法在
x方向和y方向
的平均绝对误差分布降低了约67.44%和69.09%,在时变偏态噪声环境下分别降低了约71.99%和70.90%。这些结果表明,改进的MEEKF算法在处理时变非高斯观测噪声环境时具有显著的优势,提供了一种有效的解决方案。
参考文献
|
相关文章
|
多维度评价
Select
3.
基于改进YOLOv8模型的雨雾天气目标识别算法
张首一, 申强, 郭怡然, 王晗瑜
计算机科学 2026, 53 (
6A
): 250300090-7. DOI:
10.11896/jsjkx.250300090
摘要
(
58
)
PDF(pc)
(3190KB)(
42
)
可视化
收藏
针对传统目标检测算法在雨雾天气条件下识别精度下降的问题,提出了一种基于改进YOLOv8模型的目标检测方法。首先,引入FogEnhanceNet去雾增强模块,在模型输入阶段提升目标区域的对比度和清晰度,以增强特征可辨识度;其次,结合自适应对比度注意力机制,动态调整通道与空间信息权重,优化目标特征在低对比度环境下的表达能力;最后,设计轻量化C2f-Ghost-GF结构,以减少模型参数量,同时利用导向滤波增强雾天图像的边缘特征提取能力。实验结果表明,改进模型在模型参数量不明显增加的情况下目标检测平均精度均值(mAP)提升了11.3%,为复杂天气条件下的目标检测提供了有效的解决方案。
参考文献
|
相关文章
|
多维度评价
Select
4.
基于黎曼优化的遮挡头部姿态估计算法
王宝会, 谭英洁, 陈继轩
计算机科学 2026, 53 (
6A
): 250300109-9. DOI:
10.11896/jsjkx.250300109
摘要
(
63
)
PDF(pc)
(2852KB)(
33
)
可视化
收藏
人体头部姿态估计是深度学习领域的重要任务,尤其在车载辅助驾驶系统中,它作为检测疲劳驾驶的关键手段,具有广泛的应用前景。然而,在实际应用中,面部遮挡常常导致关键特征点丢失,严重降低模型精度。针对这一难题,本文提出了6DRepLKNet-RGO算法。该算法在6DRepNet的基础上,通过结构重参数化设计,优化了网络结构,增强了特征提取能力。同时,结合黎曼流形梯度优化策略,优化了三维姿态表示方式的学习过程,减少了训练误差。为了进一步提高模型对遮挡情况下的姿态估计精度,增加了随机擦除的数据增强方法。实验表明,6DRepLKNet-RGO在BIWI和AFLW2000等公开数据集上,相较于 6DRepNet减少了5%以上的误差,并在MAE指标上超越了其他先进模型,验证了其有效性。
参考文献
|
相关文章
|
多维度评价
Select
5.
基于深度学习和先验校正的水表读数识别
楚春雨, 姜飞龙
计算机科学 2026, 53 (
6A
): 250300143-7. DOI:
10.11896/jsjkx.250300143
摘要
(
60
)
PDF(pc)
(3890KB)(
39
)
可视化
收藏
现有基于深度学习的水表读数识别方法一般是孤立地对水表的每一位数字或指针进行识别,再将各个位的识别结果进行简单拼接从而得到最终结果。然而,由于水表计数齿轮之间存在咬合间隙、水表自身可能存在结构误差以及拍摄角度等原因,可能会出现水表字轮数字显示不完整、字轮转到两个数字之间、指针指示偏差等情况,此时若简单地将每一位数字或指针的识别结果进行组合就会导致最终识别结果的错误。针对上述问题,文中提出一种基于深度学习与先验校正的水表读数识别方法,该方法基于PaddlePaddle框架,使用轻量化模型架构MobileNetV3与SVTR对字轮区域进行读取,同时使用图像处理技术读取指针读数,最后充分利用水表字轮各位数字以及各位指针读数之间的关联性先验知识对识别结果进行校正。文中讨论了字轮区域与指针区域的识别与校正方法,将其应用在水表图片进行实验测试,并与已有方法进行对比,结果表明文中提出的方法能够有效提高水表读数识别结果的准确性。
参考文献
|
相关文章
|
多维度评价
Select
6.
基于改进YOLOv5s的航站楼应急状况检测算法
刘岱, 安鹏宇, 王凯
计算机科学 2026, 53 (
6A
): 250300174-7. DOI:
10.11896/jsjkx.250300174
摘要
(
58
)
PDF(pc)
(3753KB)(
42
)
可视化
收藏
针对航站楼对较高应急响应能力的需求,对现有的YOLOv5s目标检测模型进行改进优化,以适应航站楼在复杂环境下的应急状况检测。文中的检测目标有3类:火焰、烟雾和人员摔倒。该研究对传统YOLOv5s模型进行了3项改进:引入MPDIoU损失函数、引入softNMS非极大值抑制算法、在小目标层添加BiFormer注意力机制。该研究使用消融实验和对比实验证明了改进的有效性,实验结果表明,改进后的模型在使用自建数据集进行训练后表现出了优秀的性能,在mAP@0.5和mAP@0.5:0.95这两个平均精度指标上获得了显著提升,分别达到了93.1%和63.5%,相比YOLOv5s原模型分别提升了1.7%和4.2%,相比最新模型YOLOv11分别提升了1.1%和5%。 改进后的模型在进行航站楼视频流检测时表现出较好的实时性能,并且模型权重较小使得部署比较容易,满足了航站楼应急状况检测的需求,具有较高的应用价值。
参考文献
|
相关文章
|
多维度评价
Select
7.
基于RWM和多尺度注意力的车辆重识别
李亚龙, 王海瑞, 朱贵富, 卢世宇
计算机科学 2026, 53 (
6A
): 250400017-8. DOI:
10.11896/jsjkx.250400017
摘要
(
48
)
PDF(pc)
(3436KB)(
38
)
可视化
收藏
针对现有车辆重识别任务中样本类内差异性大和类间相似度高,导致关键特征提取、全局与局部特征融合不足的问题,提出了一种基于RWM和多尺度注意力的车辆重识别方法。首先,设计了一种区域加权映射(RWM),强化图像中关键区域的特征表示,有效减少背景信息的干扰;其次,在Transformer结构的自注意力机制基础上,引入了多尺度注意力模块(MAB),结合大核感受野和多尺度特性,实现对全局结构信息的有效建模,同时增强局部细节的表达能力,提高模型的区分能力;最后,构建混合损失函数,优化模型的特征学习过程,使不同类别的车辆特征更加可分,提升泛化能力。将所提方法在VeRi-776和VehicleID数据集上进行实验,CMC@1分别达到97.4%和85.8%,CMC@5分别达到98.9%和97.7%,结果表明所提方法能够提取更具判别力的车辆特征。
参考文献
|
相关文章
|
多维度评价
Select
8.
基于脑解剖结构的胎儿小脑产前诊断
吴晓晓, 吴兴隆
计算机科学 2026, 53 (
6A
): 250400049-7. DOI:
10.11896/jsjkx.250400049
摘要
(
52
)
PDF(pc)
(3433KB)(
41
)
可视化
收藏
胎儿小脑发育不良(CH)是一种严重的中枢神经系统发育异常,其早期诊断对胎儿健康至关重要。对此,提出一种基于脑解剖结构的网络(Brain Anatomy-Based Network,BAB-Net),用于胎儿CH的产前诊断,旨在提高超声图像的诊断准确性。BAB-Net以超声图像和脑部解剖结构特征作为输入,利用解剖结构约束网络进行特征提取与融合。收集了2019年9月至2023年9月期间某三甲医院的超声图像数据,共纳入301例CH胎儿病例和547例正常胎儿病例。病例中小脑、延髓池及颅骨边界均由经验丰富的超声医师标定。在训练集上完成模型训练后,BAB-Net在两个独立测试集上的分类准确率分别达到0.977 8和0.922 2,显著优于多个主流分类网络。在孕周小于30周的病例中,BAB-Net表现出较高的诊断准确性。进一步分析发现,胎儿小脑及延髓池的解剖结构对网络性能的影响大于颅骨结构。通过融合解剖结构约束,BAB-Net有效提升了胎儿CH的诊断精度,为CH的产前筛查提供了新的技术手段,并为临床医生在孕期管理和精准干预方面提供了重要参考。
参考文献
|
相关文章
|
多维度评价
Select
9.
基于改进MobileNetV4的电力设备红外与可见光图像单应性估计
王胜, 张凌浩, 张菊玲, 庞博, 郗宁, 佘文魁
计算机科学 2026, 53 (
6A
): 250400077-7. DOI:
10.11896/jsjkx.250400077
摘要
(
50
)
PDF(pc)
(3343KB)(
32
)
可视化
收藏
红外图像与可见光图像的单应性估计是提升电力设备定位精度和缺陷检测准确度的关键技术之一。针对现有方法在电力设备红外与可见光图像单应性估计中精度不足和模型规模较大的问题,提出了一种轻量化的基于改进MobileNetV4的单应性估计方法。首先,首次将MobileNet应用于单应性估计任务,设计了一种轻量级的估计模型。其次,通过在MobileNetV4的各阶段引入CBAM模块,突出了特征图中的关键特征,从而提出了一种改进的MobileNetV4模型,即CBMobileNet。最后,使用L1范数剪枝算法,在确保性能损失较小的同时,大幅降低了模型的参数量和计算复杂度。实验结果表明,在合成基准数据集上,相较于次优算法,所提方法的平均角点误差从5.06显著下降至4.95。此外,相较于原始模型,剪枝后的模型在参数量上从10.04 MB显著减少至6.91 MB,FLOPs从1 029.48 MB显著降低至755.11 MB,而平均角点误差仅从4.93略微上升至4.95。
参考文献
|
相关文章
|
多维度评价
Select
10.
基于Transformer的农业病虫害自动问答模型
段鹏松, 罗谕, 王超
计算机科学 2026, 53 (
6A
): 250400114-9. DOI:
10.11896/jsjkx.250400114
摘要
(
71
)
PDF(pc)
(2980KB)(
37
)
可视化
收藏
针对农业病虫害识别中存在的识别精度不足、缺乏防治建议生成能力等问题,提出一种结合计算机视觉技术与指令微调策略的自动问答模型。该模型采用改进的Vision Transformer模型对农业作物病虫害图像进行分类,并引入非对称卷积嵌入模块和通道注意力机制增强模型特征提取能力,以提升模型在大规模数据集上的分类准确率。基于分类结果,结合Low-Rank Adaptation技术对百川大语言模型进行指令微调,生成更精准和实用的防治建议,提升了模型在农业场景中的应用效果。所提模型基于华为MindSpore框架开发,并使用昇腾910NPU进行训练,其训练和推理采用的软硬件体系全国产化。实验结果表明,采用改进的Vision Transformer模型与指令微调策略相结合的方式,不仅分类准确率得到明显提升,还能够生成极具操作性的防治建议。
参考文献
|
相关文章
|
多维度评价
Select
11.
融合多尺度特征筛选的轻量露天矿爆堆矿石图像分割算法
顾清华, 马祥, 李学现
计算机科学 2026, 53 (
6A
): 250500016-8. DOI:
10.11896/jsjkx.250500016
摘要
(
62
)
PDF(pc)
(4396KB)(
42
)
可视化
收藏
随着智慧矿山的快速发展,实时精准识别爆堆矿石铲装过程中的大块矿石已成为保障运输安全与效率的关键需求。针对露天矿爆堆矿石图像存在形状高度不规则、颗粒间严重重叠、图像分辨率低及特征稀疏等挑战,文中提出一种轻量化爆堆矿石图像分割算法,通过多维度模型优化实现精度与效率的平衡。首先,使用DynamicHGNetv22(Dynamic High Performance GPU Network version2)层级图网络的拓扑特性重构主干网络,通过动态路由机制压缩冗余特征,将模型体积缩减42.4%;其次,设计HSFPN(High-level Screening-feature Fusion Pyramid)高阶筛选特征融合金字塔作为颈部网络,采用通道注意力引导的多尺度特征筛选机制,在降低27.4%计算量的同时提升跨尺度特征融合能力;然后,构建轻量化分割头(Light Head),通过深度可分离卷积与特征蒸馏技术进一步优化计算效率;最后,引入EMASlideLoss(Exponential Moving Average SlideLoss)损失函数,基于指数移动平均策略动态调节难易样本权重,显著提升模型对低质量矿石目标的边缘分割精度。实验结果表明,相较于 YOLO11n-seg基准模型,所提方法的参数量和计算量分别缩减42.4%和27.4%,mAP50和mAP50:95分别提高了0.1%和2.1%,不仅满足矿山场景高精度实时分割需求,其轻量化特性更是可直接部署于边缘计算设备,为智能铲装系统的大块矿石预警提供可靠技术支撑。
参考文献
|
相关文章
|
多维度评价
Select
12.
基于双域注意力和特征融合的航拍图像目标检测模型
毛利宏, 汤建军, 陈铜, 张瑞
计算机科学 2026, 53 (
6A
): 250600036-7. DOI:
10.11896/jsjkx.250600036
摘要
(
48
)
PDF(pc)
(4303KB)(
35
)
可视化
收藏
随着我国低空经济战略地位的提升,无人机航拍图像目标检测在复杂场景下的精准检测成为关键技术。但航拍图像存在目标密集、背景复杂、小目标占比较大等特点,基于深度学习的目标检测模型面临特征提取困难与检测精度较低的问题,对此,提出了一种基于双域注意力和特征融合的航拍图像目标检测模型。首先设计通道域-空间域联合的双域注意力模块,利用动态权重分配机制抑制背景噪声并强化关键特征通道;其次构建跨层级多尺度特征融合网络,采用残差融合策略与可学习权重实现多尺度特征交互;最后新增20×20像素小目标检测头提升对小目标的检测能力。实验结果表明:在VisDrone2019数据集上,所提模型的均值平均精度(mAP
0.5
)与Faster-RCNN,LFET-Net,YOLOv5x,YOLOv8,YOLOv9,YOLOv10,YOLOv11相比分别提升97.3%,18.6%,22.7%,33.7%,12.2%,18.4%,37.9%,充分验证了该模型在航拍图像目标检测任务中的有效性。
参考文献
|
相关文章
|
多维度评价
Select
13.
SeguGAN:基于生成对抗网络的车牌图像超分辨率重构研究
黄海新, 侯广帅, 何添禹
计算机科学 2026, 53 (
6A
): 250600070-5. DOI:
10.11896/jsjkx.250600070
摘要
(
51
)
PDF(pc)
(3270KB)(
36
)
可视化
收藏
在智慧交通系统中,由于监控摄像头捕捉的车牌图像存在光照影响、运动模糊、获取的车牌图像分辨率低等问题,超分辨率重构在车牌图像的研究受到广泛关注。现有超分辨率方法往往存在重建图像存在伪影、高频细节丢失导致图像细节边缘模糊等问题,因此提出了SeguGAN框架。首先,由预训练视觉模型CLIP提取车牌语义信息,在判别器中添加语义感知模块(SeMSCA)融合语义信息与图像特征,提升判别器能力;其次,在生成器中引入门控机制融合两个不同分支(RRDB,CAMConv)提取的图像特征,提升图像重建质量。最后,使用动态Tanh(DyT)代替传统层归一化,简化模型,提升模型能力。为验证Segu-GAN的有效性,在公开数据集CCPD2019和CCPD2020上进行实验,实验中SeguGAN达到33.20 dB PSNR与0.906 SSIM,较主流的ESRGAN,SRGAN,ECBSR,RCAN,SwinIR模型PSNR平均提升5.9%,SSIM平均提升1.9%。该结果证实所提方法能够优化车牌图像的超分辨率重建效果。
参考文献
|
相关文章
|
多维度评价
Select
14.
基于多尺度特征融合注意力与跨层聚合的输电线路金具缺陷检测
陈典龙, 刘腾彬, 高雄, 田子坚, 朱文兵, 邹顺, 王强
计算机科学 2026, 53 (
6A
): 250600110-7. DOI:
10.11896/jsjkx.250600110
摘要
(
57
)
PDF(pc)
(4085KB)(
32
)
可视化
收藏
在You Only Look Once(YOLO)系列模型通用框架基础上提出了一种基于多尺度特征融合注意力与跨层聚合的输电线路金具缺陷检测方法。针对输电线路金具在复杂环境下缺陷检测精度不高的问题,在网络的特征提取部分引入了多尺度双分支注意力(MDA)机制,用于捕捉多尺度特征跨维度的交互关系,构建维度间的长距离依赖关系,有效提高检测性能。同时,针对特征传输过程细节易丢失的问题,提出了跨层聚合模块(CLA),通过将骨干网络的多级特征层与检测颈部的多级检测层进行跨层聚合,保留了特征传输过程中可能丢失的多级细粒度信息。相较于其他先进的目标检测模型,所提方法在真实输电线路金具缺陷数据集上取得了较高的检测精度,特别是在小目标缺陷检测和复杂背景抑制方面表现优异,展示了其在输电线路维护中的实际应用价值。
参考文献
|
相关文章
|
多维度评价
Select
15.
基于CTC-Conformer模型的方言精准识别
沈迎春, 冯晓涵, 李倩
计算机科学 2026, 53 (
6A
): 250600112-8. DOI:
10.11896/jsjkx.250600112
摘要
(
62
)
PDF(pc)
(2221KB)(
41
)
可视化
收藏
随着语音识别技术的快速发展,方言语音识别在多种应用场景下具有重要意义。针对存在发音多变、语速不一及噪声干扰等挑战的方言识别任务,提出了一种基于结合连接时序分类(Connectionist Temporal Classification,CTC)方法和Conformer模型的方言语音识别方法,旨在提升方言语音的识别精度与鲁棒性。模型结合了Conformer架构和CTC机制,编码器通过卷积神经网络与多头自注意力机制提取音频的局部特征和长时依赖信息,增强对方言语音的理解;解码器采用CTC机制双重注意力机制减少对齐需求并增强上下文建模能力,多任务学习策略优化了CTC损失和交叉熵损失之间的平衡,进一步提升了识别精度。实验结果表明,CTC-Conformer模型在标准测试集上达到了79.08%的字准确率,并在噪声干扰下仍能保持稳定效果,在严重噪声环境下仍能达到65.20%的准确率,显示了良好的鲁棒性和精度。综上所述,CTC-Conformer模型为方言语音识别提供了一种高效、鲁棒的解决方案,并在实际应用中具有广泛的潜力。
参考文献
|
相关文章
|
多维度评价
Select
16.
基于SAM的视觉应用综述
张旭, 王安志, 杨成帮, 吴锦涛
计算机科学 2026, 53 (
6A
): 250600115-9. DOI:
10.11896/jsjkx.250600115
摘要
(
71
)
PDF(pc)
(2702KB)(
55
)
可视化
收藏
分割一切模型(SAM)作为一种通用的视觉分割大模型,凭借其强大的零样本泛化能力和交互式分割能力,为计算机视觉领域带来了新的机遇。SAM通过大规模的数据训练和灵活的提示机制,构建起了跨领域任务的高效适配能力,能够快速适应医学影像分析、自动驾驶等多种视觉任务。为了深入了解SAM在各类视觉应用中的性能瓶颈与技术挑战,探索其在视觉任务中的优化路径。首先,对SAM的核心框架进行介绍;然后,对改进模型进行分类,并分析其适用场景;在此基础上,对SAM在不同视觉任务中的研究现状进行梳理和总结,并在各个应用场景常见的数据集和评价指标上进行实验对比和论证;最后,对SAM在不同视觉任务中存在的局限性和未来的发展方向进行深入分析和讨论。
参考文献
|
相关文章
|
多维度评价
Select
17.
LitchiNet:融合多尺度门控注意力模块与类别不平衡感知的荔枝品种轻量级识别模型
苏烨, 徐鑫, 赵龙龙, 李晓丽, 陈盼, 陈劲松
计算机科学 2026, 53 (
6A
): 250600127-8. DOI:
10.11896/jsjkx.250600127
摘要
(
61
)
PDF(pc)
(3437KB)(
44
)
可视化
收藏
精准高效的荔枝品种识别,是实现采后荔枝品质智能化检测的关键环节。当前,深度学习模型在该任务中仍面临细粒度特征难以区分、样本数量有限、类别分布不均以及部署资源受限等多重挑战。为应对上述挑战,提出了一种轻量化荔枝品种识别模型(LitchiNet),以预训练的SqueezeNet1.0作为实验验证的主干网络,嵌入一种新颖的多尺度门控注意力模块(Multi-scale Gated Attention,MSGA),通过多尺度卷积融合、通道注意力与轻量门控机制协同作用,在残差连接的基础上强化关键特征区域响应,以增强模型对荔枝品种细粒度差异的识别能力。在LitchiNet的最后阶段,设计了一种计算资源友好、推理效率较高的分类器结构。为了应对类别不平衡问题,提出一种类别不平衡感知损失函数(Class Imbalance Awareness Loss,CIA Loss),通过引入类别权重因子与难易样本调节机制,有效缓解训练样本分布不均带来的偏差。实验基于Github公开荔枝品种识别数据集开展研究。结果显示,LitchiNet在准确率、精确率、召回率、F1分数上均表现优异,其中召回率达到99.40%,明显优于4种主流轻量深度学习模型。同时,模型参数仅为 3.210×10
6
,具备良好的边缘部署适应性。对比4种常见注意力模块的实验结果显示,嵌入 MSGA 的模型具备更快的收敛速度、更低的最终损失及更高的识别精度。此外,LitchiNet的模块化设计支持与任意神经网络主干结构兼容,具备良好的通用性和可拓展性。LitchiNet不仅为荔枝品种智能化识别提供了切实可行的解决方案,也为水果品种细粒度识别研究及农业人工智能技术发展提供了新的思路与技术范式。
参考文献
|
相关文章
|
多维度评价
Select
18.
HCKD:基于皮肤镜图像的轻量级皮肤病变分类方法
李思雨, 钱文华
计算机科学 2026, 53 (
6A
): 250600143-9. DOI:
10.11896/jsjkx.250600143
摘要
(
61
)
PDF(pc)
(4250KB)(
47
)
可视化
收藏
皮肤癌是最常见的恶性肿瘤之一,早期诊断并积极治疗能显著提高患者的生存率。现有的基于卷积神经网络的皮肤病自动诊断研究致力于开发更深层的架构,计算资源开销和模型参数量随之增加,限制了模型的轻量化部署。同时皮肤病数据存在分布不平衡问题,导致模型在识别罕见病类时性能下降。针对当前皮肤病自动诊断系统面临的计算复杂度高和数据分布不平衡的双重挑战,提出了层次协同知识蒸馏方法 HCKD(Hierarchical Collaborative Knowledge Distillation),通过联合优化全连接层的响应知识蒸馏、嵌入层的结构关系知识蒸馏和卷积层的通道特征知识蒸馏,构建层次化知识迁移机制,实现模型高效压缩,同时引入加权交叉熵损失函数以增强模型对罕见病类的识别能力。在ISIC 2019数据集的分类任务中,HCKD方法训练的学生模型取得了85.7%的准确率、82.6%的平衡准确率,且模型参数量和计算资源开销较教师模型大幅降低,识别罕见病类能力得到提升,与当前3种流行的知识蒸馏方法相比达到了最佳效果。
参考文献
|
相关文章
|
多维度评价
Select
19.
基于拓扑信息的多层图卷积动作识别方法
黄海新, 何添禹, 侯广帅
计算机科学 2026, 53 (
6A
): 250600147-5. DOI:
10.11896/jsjkx.250600147
摘要
(
54
)
PDF(pc)
(3118KB)(
39
)
可视化
收藏
人体动作识别通过对视频中的时空特征进行分析,实现了对人体行为的识别。作为计算机视觉领域的重要研究课题之一,其高效准确的识别性能,已在人机交互、智能安防等多个应用场景中展现出广泛的应用价值。图卷积网络(Graph Convolutional Networks,GCNs)凭借在人体骨骼拓扑结构建模方面的显著优势,已成为动作识别任务中的主流方法。然而,现有方法通常对整体骨架结构进行统一建模,忽略了人体由多个功能性区域组成的层次化特征,导致模型在复杂行为识别任务中的表现受限。为此,提出了一种基于拓扑信息的多层图卷积网络(TM-GCN)。模型采用多分支架构,通过对人体骨架进行分区建模,有效捕捉骨骼节点间的空间依赖关系。同时引入拓扑感知单元,在图卷积过程中提取并融合拓扑特征,增强模型对骨骼拓扑信息的表达能力。基于 NTU-RGB+D 数据集的实验结果表明,TM-GCN在人体骨骼动作识别任务中取得了较为出色的性能,有效提升了动作识别的准确率。
参考文献
|
相关文章
|
多维度评价
Select
20.
基于参数自适应灰狼优化算法的非同步动态图像拼接方法
单程程, 李未亭, 梅春, 赵辉, 钱伟行, 曾庆化
计算机科学 2026, 53 (
6A
): 250600169-8. DOI:
10.11896/jsjkx.250600169
摘要
(
56
)
PDF(pc)
(3244KB)(
40
)
可视化
收藏
针对动态场景下非同步图像拼接时效率低下与动态目标失真的问题,提出了一种基于灰狼优化算法的参数自适应图像拼接方法。该方法将GWO的群体智能搜索机制引入RANSAC框架,将关键点子集映射为“狼群个体”,利用
α,β,δ
狼的引导搜索机制,使关键点选择具有“趋优性”,在非同步状态下保证动态目标的完整性和连续性。此外,为提高算法在不同场景下的鲁棒性和处理效率,引入了两阶段参数自适应机制,包括低分辨率预计算和动态终止条件,实现了对误差容限、迭代次数等核心参数的自动化调整。在StabStitch-D数据集上的实验表明:在相同迭代条件下,GWO-RANSAC较传统RANSAC内点匹配率提升4.91%,PSNR值提升11.4%(从32.5dB提升至36.2dB),SSIM值提升5.1%(从0.881提升至0.926),同时能够减少拼接图像中的黑边与错位现象,并且在复杂场景下也能保证动态目标物体的完整性和连续性。理论分析表明,该方法在资源受限环境和动态非同步场景中具有显著优势,与深度学习方法形成有效互补。
参考文献
|
相关文章
|
多维度评价
Select
21.
面向景象匹配导航系统基准图的语义感知主动学习方法
单程程, 梅春, 李未亭, 郭原源, 钱伟行, 熊智
计算机科学 2026, 53 (
6A
): 250600228-8. DOI:
10.11896/jsjkx.250600228
摘要
(
55
)
PDF(pc)
(3058KB)(
28
)
可视化
收藏
航空遥感目标检测技术所获取的高精度基准图语义信息,可有效提升景象匹配导航系统的感知维度。由于遥感图像尺度大、目标密度高且标注成本昂贵,限制了高性能检测模型的训练与应用。针对景象匹配场景的语义目标检测中面临的源域与目标域数据分布差异及目标域标注数据不足的问题,提出了一种高效的主动学习方法来优化目标域样本的选择。该方法利用源域已标注数据和目标域未标注数据,通过主动学习策略从目标域中选取具有高信息量的样本进行人工标注,从而弥补目标域数据标注不足带来的影响。文中设计了3种主动学习评分函数——一致性评分、判别器评分和余弦差异评分,分别从检测框预测不一致性、领域归属概率以及特征差异角度等方面来评估目标域样本的标注价值。同时,还构建了一套针对目标检测任务的评估框架,考虑每张图像的整体标注效果并量化每个检测框的标注成本。实验证明,该最佳方法能够在目标域上将主动学习的目标检测性能提高约3.29%,同时将目标域所需的标注边界框数量减少约17.6%。所提方法在标注资源有限的条件下,有效提升了目标检测性能与领域迁移能力,能够应对源域与目标域之间因分布差异导致的模型性能下降问题,为遥感场景中的跨域目标检测提供了新的解决思路,为构建高精度的语义基准图提供了可靠的数据支持,进而提升了景象匹配导航的精度和可靠性。
参考文献
|
相关文章
|
多维度评价
Select
22.
基于条件化双网络的红外与可见光图像光照自适应融合
王熔硕, 王佳佳, 贾振红, 周刚
计算机科学 2026, 53 (
6A
): 250600235-9. DOI:
10.11896/jsjkx.250600235
摘要
(
50
)
PDF(pc)
(4789KB)(
43
)
可视化
收藏
红外图像与可见光图像融合在复杂场景下能兼顾细节与目标,但昼夜光照差异导致两种图像的关注点存在内在冲突:白天应保留可见光图像的纹理结构,夜间则依赖红外图像突出目标,单一网络难以在不同光照条件下实现融合策略的最优权衡,导致性能退化。因此,研究目的是解决这种跨光照条件下的策略冲突,实现一种能够自适应光照变化的稳健融合方法。为此,提出一种条件化双网络框架:通过光照感知实现对昼夜场景的自适应分配,并在融合过程中设计互补信息提取与软切换机制,以平滑应对连续光照过渡。实验在 MSRS,M3FD 与 TNO 数据集上进行,结果表明,该方法在结构保真与目标显著性指标上均取得领先,显著克服了昼夜冲突带来的性能瓶颈。结果验证了光照自适应建模是提升红外图像与可见光图像融合鲁棒性的重要途径。
参考文献
|
相关文章
|
多维度评价
Select
23.
基于深度学习的小目标检测研究综述
陈诺, 赵鹏, 桓海盛
计算机科学 2026, 53 (
6A
): 250700022-9. DOI:
10.11896/jsjkx.250700022
摘要
(
68
)
PDF(pc)
(2514KB)(
41
)
可视化
收藏
小目标检测作为目标检测领域的关键难点与重要分支,因具有目标尺寸微小、特征模糊、易受背景干扰等特性,一直是计算机视觉领域的研究热点。近年来,卷积神经网络的快速发展显著提高了小目标检测的性能。全面回顾了用于目标检测的深度学习方法,总结了小目标检测中的相关挑战,主要包括特征提取时空间信息丢失,目标本身可用信息匮乏,以及标注样本数量不足导致的模型泛化能力弱等问题。随后,针对上述问题,重点分析了小目标检测的方法和优化策略。其次,聚焦于自动驾驶、无人机检测以及医学影像等典型应用场景,详细探讨了相关检测方法的实践应用与创新成果。最后,对小目标检测的未来研究方向进行展望,为后续的研究工作指明方向。
参考文献
|
相关文章
|
多维度评价
Select
24.
基于多光源图像融合的避雷器故障识别技术研究
王浩钊, 符方达, 吴育毅, 王录亮, 余阳, 漆一帆
计算机科学 2026, 53 (
6A
): 250700042-8. DOI:
10.11896/jsjkx.250700042
摘要
(
55
)
PDF(pc)
(4494KB)(
44
)
可视化
收藏
针对传统单一模态图像在避雷器故障检测中信息表征不完整、小目标特征易丢失的问题,提出一种融合多尺度残差金字塔注意力网络(MSRPAN)与轻量化目标检测模型 YOLO11-CGB的避雷器故障识别方法。MSRPAN通过多模态图像多尺度深层特征提取,结合残差注意力机制,避免梯度消失,增强特征表达能力,以解决单一模态特征缺陷。设计的YOLO11-CGB模型在主干网络嵌入卷积块注意力模块(CBAM),采用GhostConv替代传统卷积层降低计算复杂度,结合双向特征金字塔网络(BiFPN)优化多尺度特征融合,提升复杂背景下小目标检测能力。实验表明,MSRPAN融合方法在主观和客观方面的评估均优于常见的IHS,Brovey,PCA,WT,CNN融合算法。YOLO11-CGB模型在自建数据集上实现94.88%的 mAP@0.5与94% 的召回率,对融合图像的破损(P)故障、闪络(S)故障、裂纹(L)故障的识别置信度最高可达0.88,0.85和0.84,优于单一模态图像(红外和可见光图像)。
参考文献
|
相关文章
|
多维度评价
Select
25.
基于多模态特征融合的智能识别方法
钟浩, 孔庆轩, 蔡先庆, 黎志忠, 孙浩
计算机科学 2026, 53 (
6A
): 250700065-10. DOI:
10.11896/jsjkx.250700065
摘要
(
61
)
PDF(pc)
(5504KB)(
43
)
可视化
收藏
针对复杂交通场景中光照变化、姿态差异与遮挡导致的车辆识别性能下降问题,提出轻量级多模态融合框架 MM-ASTFL。其核心创新体现在三重注意力机制:一是自适应通道-空间注意力(ACSA),动态加权 MobileNetV2 特征,显著增强车牌、车灯等关键区域表征;二是时间感知注意力增强 LSTM(TA-LSTM),以多头自注意力捕获时序关键帧,精准刻画变道、转弯等驾驶行为;三是跨模态交叉注意力,实现视觉-时序信息的双向引导与深度聚合。在VeRi-776上的实验表明,MM-ASTFL车辆重识别的mAP达89.8%、Rank-1达92.6%,较SOTA提升1.7%与1.6%;驾驶行为分类的F1-score达92.4%,提升2.2%;轨迹预测的ADE与FDE分别降至0.68 m与1.25 m,误差降低13.3%与15.4%。消融实验证实各模块均带来显著增益,可视化分析进一步验证其在逆光、遮挡等极端条件下的鲁棒性,为智能交通系统提供了高效、可靠的解决方案。
参考文献
|
相关文章
|
多维度评价
Select
26.
基于分阶段训练策略与多尺度特征融合的目标检测方法
瞿洁武, 路新喜, 孙健, 柳燕, 高玲, 徐彬彬
计算机科学 2026, 53 (
6A
): 250700088-7. DOI:
10.11896/jsjkx.250700088
摘要
(
59
)
PDF(pc)
(2740KB)(
35
)
可视化
收藏
针对DETR(Detection Transformer)系列目标检测方法在推理阶段存在计算瓶颈、难以兼顾实时性与精度的问题,提出了一种基于分阶段训练策略与多尺度特征融合的改进方法。具体而言,通过简化DETR的多层编码器结构降低计算复杂度,并采用分阶段训练策略提升特征表达能力和模型收敛速度。第一阶段采用一对多标签匹配获取高质量二维多尺度特征,第二阶段冻结第一阶段的网络权重,并引入并行注意力卷积融合模块进一步细化特征。实验结果表明,所提方法在COCO数据集上较基线模型实现了5倍的推理速度提升,并带来了1.5个百分点的AP增益,有效缓解了DETR在推理阶段效率低下的问题;在BitVehicle数据集上也取得了1.4个百分点的AP提升。
参考文献
|
相关文章
|
多维度评价
Select
27.
基于RGB-IR多模态融合的番茄小目标检测
董烨, 连心悦, 王雨阳, 欧新宇
计算机科学 2026, 53 (
6A
): 250700173-8. DOI:
10.11896/jsjkx.250700173
摘要
(
91
)
PDF(pc)
(2754KB)(
69
)
可视化
收藏
番茄自动化采摘在现代农业生产中至关重要,能够显著提升效率,降低成本,并保障果实品质。然而,现有基于单一模态的自动采摘技术在果园环境中仍面临诸多挑战:复杂光照条件与枝叶遮挡容易导致番茄目标出现误检和漏检;同时,番茄作为小目标,在传统RGB图像中的特征易被背景噪声淹没;此外,单一传感器数据难以全面捕捉目标特征,限制了模型的鲁棒性与适应性。针对上述问题,提出一种基于多模态特征融合的RTDMF模型(Robust Tomato Detection with Multi-modal Fusion),通过整合RGB与IR图像的互补特性,增强番茄检测的精准性与稳定性。该模型在YOLOv5基础上进行优化,针对小目标检测引入轻量化深度可分离卷积与自适应锚框策略,以提升对细微特征的捕捉能力;采用双分支架构分别处理RGB和IR图像,并借助自注意力机制实现多模态特征的高效融合,充分结合色彩、纹理与温度信息;此外,引入Mosaic数据增强与动态学习率策略,进一步提升模型的泛化性能与收敛效率。实验结果表明,在包含多种光照与遮挡条件的“Multimodal image dataset of tomato fruits with different maturity”数据集上,RTDMF模型将使平均精度(mAP)提升9.7%,召回率提高0.6%,漏检率降低2.3%,误检率降低3.1%。可视化结果进一步验证了该模型在低对比度、遮挡等复杂场景下的强适应性。
参考文献
|
相关文章
|
多维度评价
Select
28.
用于无人机-卫星跨视角视觉地理定位的金字塔池化视觉状态空间模型
岳文洁, 蒋杰, 詹礼新, 周秉泉, 周天健
计算机科学 2026, 53 (
6A
): 250700192-7. DOI:
10.11896/jsjkx.250700192
摘要
(
54
)
PDF(pc)
(2980KB)(
32
)
可视化
收藏
无人机与卫星图像之间的跨视角地理定位作为一种替代GNSS-INS的有力手段,在卫星信号弱或受阻的环境下展现出巨大潜力。然而,由于视角、光照和分辨率等差异所带来的巨大视觉变化,会对图像匹配造成严峻挑战。为此,提出了一种新型方法P2VSSM(Pyramid Pooling Visual State Space Model),通过将金字塔池化自注意力机制嵌入Mamba架构,提升了跨视角图像的特征提取能力。设计的PPSA模块融合多尺度上下文信息,增强语义抽象能力和全局建模效果。同时,引入信息噪声对比估计损失替代传统三元组损失,避免了繁重的困难负样本挖掘过程,在训练过程中显著提升了负样本的丰富度与对比学习的稳定性。在两个公开的无人机-卫星数据集University-1652与SUES-200上的实验结果表明,此方法在无人机到卫星以及卫星到无人机的检索任务中均取得了领先性能。大量消融实验也验证了所提方法的有效性与鲁棒性。
参考文献
|
相关文章
|
多维度评价
Select
29.
面向弱纹理工件的单目实时6D位姿估计方法
冯迎宾, 康学仕, 王天龙
计算机科学 2026, 53 (
6A
): 250800006-7. DOI:
10.11896/jsjkx.250800006
摘要
(
56
)
PDF(pc)
(5520KB)(
45
)
可视化
收藏
针对工业场景中弱纹理工件尺寸不一、遮挡堆叠及光照变化等问题,提出了一种单目6D位姿估计方法RAAS-PVNet。为解决传统卷积结构在建模多尺度信息方面能力不足的问题,设计了分辨率自适应矩形卷积RARConv,动态调整卷积核大小和采样点数量,在PVNet主干网络中引入RARConv,提高了模型的多尺度能力;提出角距协同加权投票策略AS,引入方向向量延长线的垂直距离约束,结合连续权重融合机制,准确衡量每个投票点的可信度,使投票结果聚焦于高质量点,提高了模型的抗遮挡能力;面对位姿估计领域工业零件数据集匮乏的问题,设计了一种真实数据和合成数据按比例结合的数据集制作方法,构建工件数据集6DInd。实验表明,RAAS-PVNet在6DInd上的2D Projection和ADD(-S)分别提升10.22%和10.26%,在遮挡及光照变化下均具有良好的鲁棒性,30fps的处理速度满足实时性需求。
参考文献
|
相关文章
|
多维度评价
Select
30.
基于改进加权引导滤波的立体匹配算法
张奔, 朱灯林
计算机科学 2026, 53 (
6A
): 250800043-5. DOI:
10.11896/jsjkx.250800043
摘要
(
67
)
PDF(pc)
(2652KB)(
52
)
可视化
收藏
为了实现实时有效的立体匹配,在现有的局部立体匹配算法的基础上,提出了一种基于加权引导滤波的局部立体匹配算法。首先,在代价计算阶段采用多测度融合的方法。其次,在成本聚集阶段,采用加权引导滤波方法进行滤波,利用Canny算法自适应调整正则化参数,实现了更精确的成本聚集。最后,对WTA优化策略得到的视差图进行左右一致性检测(LRC)的致密化处理。通过对Middlebury数据库的图像采用该算法进行立体匹配,结果验证了算法的有效性和鲁棒性。
参考文献
|
相关文章
|
多维度评价
首页
| 前页|
后页
|
尾页
第1页 共2页 共31条记录