本数据库通过收集和整理最新科研文献信息而得,供了解领域前沿进展之用。数据源自 PubMed Data ,每日自动更新(使用关键词“['deep learning']”过滤),已收录文献数量参见 统计表格。表格内容由 GPT 自动整理,可能存在错误或遗漏,请使用时务必注意核实!
如有建议或合作意向,欢迎联系 linlin.yan(AT)bioinfo.app 或 微信 yanlinlin82。本项目遵循 MIT 许可 发布,欢迎下载 源码 自行修改使用。如觉得不错,还请不吝 给我打赏,你的支持是我继续创新的重要动力!


除通过在线浏览外,为方便用户离线查阅,本站也提供 付费下载(定价19.9元)。之所以考虑收费,是因为批量扫描这些文献并整理也是有一定成本的,还请理解并多多支持。本站数据会持续更新,而仅需一次付费,未来就可以随时重新下载到最新版本数据。
| 序号 | 推送日期 | 文章 | 类型 | 简述 | 创新点 | 不足 | 研究目的 | 研究对象 | 领域 | 病种 | 技术 | 模型 | 数据类型 | 样本量 | 算法框架 | 模型架构 | 性能指标 | 计算资源 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 1081 | 2026-08-24 |
High-accuracy hyperspectro-polarimetric real-time imaging via a deep learning empowered infrared meta-sensor
2026-Aug-20, Light, science & applications
DOI:10.1038/s41377-026-02407-1
PMID:42624839
|
研究论文 | 本文展示了一种通过元表面集成近红外相机和残差注意力网络实现高精度高光谱全斯托克斯偏振实时成像的方法,覆盖1150-1650纳米波长范围,具有167个光谱通道。 | 提出了一个元表面作为多维编码器,同时进行偏振复用和光谱色散,并定制了带有残差注意力模块的深度学习网络,以实现高精度多维信息重建,性能指标优于现有高光谱偏振相机。 | 摘要中未提及具体局限性。 | 实现高精度、实时的高光谱全斯托克斯偏振成像,在单次曝光中同时捕获光的多维信息。 | 入射光的多维信息,包括强度、偏振和光谱。 | 计算机视觉 | NA | 元表面集成成像 | 深度神经网络 | 图像 | 未提供具体样本量。 | NA | 残差注意力网络 | 光谱分辨率、图像分辨率、光谱重建精度、偏振重建精度、处理时间、帧率 | NA |
| 1082 | 2026-08-24 |
A multimodal EMG-IMU dataset and multi-dataset benchmark for deep learning-based human activity recognition
2026-Aug-20, Scientific reports
IF:3.8Q1
DOI:10.1038/s41598-026-64847-4
PMID:42624935
|
研究论文 | 本文介绍了一个结合表面肌电和惯性测量单元的多模态数据集SDALLE,并与公共数据集ENABL3S进行了基准比较,探索了基于深度学习的活动识别方法 | 提出了新的多模态EMG-IMU数据集SDALLE,并首次将其与ENABL3S数据集进行调和比较,同时探索了WGAN-GP数据增强策略用于类别平衡 | 受试者依赖的评估协议可能导致性能指标过于乐观,未评估对未见受试者的泛化能力,且数据增强未能提升准确率 | 为可穿戴传感器的人体活动识别提供一个公开的多模态数据集和协议特异的基准比较,以支持康复、辅助机器人和移动健康应用 | 九名健康男性受试者在步行、慢跑、爬楼梯和下楼时的EMG和IMU信号 | 数字病理学, 机器学习 | 不适用 | 表面肌电, 惯性测量单元, 数据增强 | CNN-LSTM, WGAN-GP | 信号数据 | 9名健康男性受试者 | 不适用 | CNN-LSTM, WGAN-GP | 准确率 | 不适用 |
| 1083 | 2026-08-24 |
Seeing Beyond RGB Capabilities: Data-Driven and Physics-Guided Broadband Spectral Extrapolation of Plasmonic Nanostructures by Deep Learning
2026-Aug-19, ACS photonics
IF:6.5Q1
DOI:10.1021/acsphotonics.5c02828
PMID:42631208
|
研究论文 | 本文介绍了一种基于深度学习的范式,能够从信息有限的RGB图像中同时推断大量等离激元纳米结构的宽带暗场光谱,并批量分类其形状。 | 首次将数据驱动与物理引导的深度学习结合,实现从RGB图像到宽带光谱的外推,突破了传统成像和光谱学的分辨率-吞吐量权衡,速度提升2-4个数量级。 | 摘要未明确提及局限性。 | 开发一种快速、高精度的光学表征方法,用于纳米结构的一致性和可重复性筛选,以促进可扩展的纳米光子学应用。 | 等离激元纳米结构(纳米粒子),关注其形状和光谱响应。 | 计算机视觉,深度学习 | NA | 暗场光谱学,RGB成像 | 深度学习模型 | 图像(RGB)和光谱数据 | 大量纳米粒子(具体数量未提供) | NA | NA | 精度(与传统文化方法相当) | NA |
| 1084 | 2026-08-24 |
AI-Driven Workflow for Automated Colorimetric Isothermal Amplification for Robust Pathogen Detection on Portable Devices
2026-Aug-18, ACS omega
IF:3.7Q2
DOI:10.1021/acsomega.5c12299
PMID:42626496
|
研究论文 | 提出了一种基于AI的工作流程,用于便携设备上自动化比色环介导等温扩增(cLAMP)的病原体检测,以提高读取客观性和易用性 | 利用深度学习分割和相对最大均值差异(MMD)进行自动颜色检测,实现了多病原体检测的通用自动化流程,并能在不同光照条件下保持高准确性 | 误分类图像主要由人为错误或极端光照条件引起,且未提及计算资源需求或模型训练细节 | 开发并验证一种便携设备上cLAMP检测的自动化颜色读取工作流程,减少主观性并提高易用性 | 皮肤嗜性病毒、呼吸道病毒病原体和疟原虫三种检测面板,共527次测试中的1,636张照片 | 计算机视觉 | 传染病(皮肤嗜性病毒、呼吸道病毒、疟疾) | 比色环介导等温扩增(cLAMP) | 深度学习分割模型(具体架构未指定,可能包含U-Net等) | 图像 | 527次测试,1,636张照片,三个检测面板 | 未指定(可能使用PyTorch或TensorFlow,但未在摘要中提及) | 深度学习分割模型(具体架构未指定),Otsu二值化 | 准确性(Accuracy) | 未提及(摘要中未提供) |
| 1085 | 2026-08-24 |
Unsupervised deep learning enables blur-free resolution enhancement in two-photon microscopy
2026-Aug-17, Cell reports methods
IF:4.3Q2
DOI:10.1016/j.crmeth.2026.101476
PMID:42248144
|
研究论文 | 提出一种名为TENET的无监督深度学习框架,用于双光子显微镜图像的模糊消除和分辨率增强,同时进行语义分割。 | TENET为全无监督框架,包含物理信息模糊生成模块和可训练的神经隐式点扩散函数,仅需近似PSF初始化,无需配对清晰图像或各向同性假设,实现高达12倍的分辨率增强和自动语义分割。 | 未提及明确限制,但可能对PSF初始化的依赖性及其在更广泛成像条件下的适用性未知。 | 开发一种无监督深度学习方法,以改善双光子显微镜成像中的轴向模糊和各向异性分辨率,简化下游分析。 | 双光子显微镜图像,包括合成图像、荧光珠和体内小胶质细胞数据集。 | 计算机视觉 | 脑肿瘤 | 双光子显微镜 | 神经网络 | 图像 | 未指定具体样本数量,但包括合成图像、荧光珠和体内小胶质细胞数据集。 | NA | TENET(未指定具体架构,如ResNet等) | 图像保真度、分割精度(未具体列出指标) | 未提及 |
| 1086 | 2026-08-24 |
DeepFaceMouse enables scalable prediction of large-scale brain activity from facial dynamics in mice
2026-Aug-17, Cell reports methods
IF:4.3Q2
DOI:10.1016/j.crmeth.2026.101480
PMID:42259296
|
研究论文 | DeepFaceMouse是一个高精度、可扩展的深度学习框架,用于分析小鼠口面部行为并从面部动态预测大规模脑活动 | 通过优化的训练、推理和数据处理流程,在多种行为条件和神经系统疾病模型中实现稳健追踪,相比现有方法提高了追踪精度和计算效率,并将行为测量质量与下游神经信号重建联系起来 | 未提及具体局限性 | 建立一个可复制、可扩展的框架,用于研究大脑-行为关系,并为评估行为建模方法提供功能基准 | 小鼠的口面部行为和大脑活动 | 计算机视觉、深度学习 | 神经系统疾病 | 姿态估计 | 深度学习模型 | 视频数据(面部动态)和脑活动数据 | 未提及具体样本数量 | 未提及 | 未提及具体架构,可能包括卷积神经网络等 | 追踪精度、计算效率、神经信号预测准确度 | GPU加速系统 |
| 1087 | 2026-08-24 |
Hierarchical geometric deep learning enables scalable analysis of molecular dynamics
2026-Aug-14, The Journal of chemical physics
IF:3.1Q1
DOI:10.1063/5.0332913
PMID:42573031
|
研究论文 | 本文展示了一种层级几何深度学习方案,通过聚合局部信息来降低内存和运行时间需求,同时保持原子细节,实现对包含数千残基的蛋白质-核酸复合物分子动力学模拟的全原子分辨率分析 | 提出层级方案聚合局部信息,解决消息传递GNN难以捕捉长程交互和全连接注意力机制计算成本随节点数平方增长的问题,在降低计算成本的同时保持或提升性能和可解释性 | 仅对数百残基系统进行了定量比较,对更大规模系统缺乏定量性能评估 | 开发可扩展的几何深度学习方法来分析分子动力学模拟数据,特别是捕捉长程交互并降低计算成本 | 蛋白质-核酸复合物的分子动力学模拟轨迹 | 机器学习 | NA | 分子动力学模拟 | 图神经网络 | 分子动力学模拟轨迹数据 | 数百至数千残基的蛋白质-核酸复合物系统 | NA | 层级图神经网络 | 计算成本、性能、可解释性 | 单GPU |
| 1088 | 2026-08-24 |
Deep learning enabled prediction of nuclear lamina-associated chromatin
2026-Aug-14, Patterns (New York, N.Y.)
DOI:10.1016/j.patter.2026.101545
PMID:42630757
|
研究论文 | 提出了一种名为LADDER的多模态深度学习模型,基于DNA序列、基因密度及LINE1和SINE密度预测核纤层相关染色质区域,并应用于跨物种分析及3D染色质模型改进 | 首次将DNA序列与基因密度及转座子密度相结合进行核纤层关联预测,模型具有细胞类型无关性,并揭示了基因组固有的纤层易感性景观 | 摘要中未提及明显局限性,但预测可能依赖输入特征质量,且未明确讨论细胞类型特异性或三维结构的影响 | 开发并验证深度学习模型预测核纤层相关染色质,并探索其在基因组结构、变异效应及3D模型中的应用 | 核纤层相关染色质区域、基因组序列特征(DNA序列、基因密度、LINE1、SINE)、物种间等位基因特异性差异、小鼠逃逸基因 | 深度学习、基因组学 | 不适用(未涉及具体疾病) | DNA测序(推断)、深度学习模型预测 | 多模态深度学习模型 | 基因组序列数据、基因密度数据、转座子密度数据、染色质关联数据、3D染色质结构数据 | 未明确提及具体样本数量,涉及基因组范围及跨物种分析 | 未明确提及 | 多模态深度学习架构(具体如CNN等未在摘要中明确) | 未明确提及,可能包含预测准确性指标(如AUC) | 未明确提及 |
| 1089 | 2026-08-24 |
Revealing hidden material composition via physics-induced deep learning for precision clinical diagnosis
2026-Aug-14, Patterns (New York, N.Y.)
DOI:10.1016/j.patter.2026.101620
PMID:42630783
|
研究论文 | 提出一种基于物理诱导深度学习的多材料分解框架,从单能CT图像中提取材料成分信息,以提升临床诊断精度。 | 将光电效应和康普顿散射的物理原理集成到深度学习网络架构中,实现了单能CT图像的高精度多材料分解。 | 未明确说明局限性。 | 利用物理诱导的深度学习实现精确的材料分解,为临床诊断提供可及的人工智能工具。 | 体模和临床患者CT图像。 | 医学影像分析 | 未明确指定具体疾病类别。 | 光谱CT成像 | 深度学习网络 | CT图像 | 包含1,637,738张CT图像,来自7,629名患者,以及体模数据集 | NA | 集成光电效应和康普顿散射物理原理的深度学习架构 | 峰值信噪比、体积分数准确率 | NA |
| 1090 | 2026-08-24 |
DFCE-KanT: predicting spatial gene expression from histology images via contrastive learning
2026-Aug-03, Bioinformatics (Oxford, England)
DOI:10.1093/bioinformatics/btag502
PMID:42421216
|
研究论文 | 提出DFCE-KanT对比学习框架,结合组织图像特征、基因特征和空间位置信息,从H&E染色图像预测空间基因表达。 | 结合DenseNet与特征通道增强注意力的图像特征提取,以及KAN与Transformer多头注意力的融合策略,增强非线性能力并提升图像与基因表达特征的兼容性。 | 未明确说明局限性,但可能涉及计算成本或数据依赖性。 | 开发一种低成本方法,从H&E图像直接预测空间基因表达,替代昂贵的空间转录组测序。 | 五种公开数据集(HER2+、cSCC、Alex、HBC和Liver)中的组织图像和对应的空间基因表达数据。 | 数字病理学 | 癌症(HER2+乳腺癌、皮肤鳞状细胞癌、肝癌等) | 空间转录组学(ST),H&E染色成像 | 对比学习框架,包含DenseNet、KAN和Transformer | 组织图像(H&E染色全切片图像)和基因表达数据 | 五个公开数据集,具体样本数量未在摘要中说明。 | PyTorch(根据GitHub代码推测) | DenseNet、KAN、Transformer | 预测准确性(具体指标如皮尔逊相关系数,未明确) | 未在摘要中说明 |
| 1091 | 2026-08-24 |
On the Utility of Foundation Models for Fast MRI: Vision-Language-Guided Image Reconstruction
2026-Aug, Magnetic resonance in medicine
IF:3.0Q2
DOI:10.1002/mrm.70374
PMID:41947281
|
研究论文 | 本研究探讨了视觉-语言基础模型通过提供高级上下文信息来增强欠采样MRI重建的能力,提出了一种语义分布引导的重建框架 | 首次将视觉-语言基础模型应用于MRI重建,通过对比学习目标将重建图像与目标语义分布对齐,实现高层语义引导,而非传统低层先验 | 摘要未明确提及局限性 | 探究视觉-语言基础模型能否通过语义空间优化改善欠采样MRI重建 | 膝关节和脑部MRI图像重建 | 计算机视觉, 医学影像 | NA | MRI | 视觉-语言基础模型, 深度学习重建方法 | 图像, 文本 | 膝关节和脑部数据集(具体样本数量未提及) | NA | NA | LPIPS, Tenengrad得分, 读者研究评分 | NA |
| 1092 | 2026-08-24 |
Automated whole-heart volumetrics and haemodynamics from 4D flow CMR magnitude images: development and validation of a deep learning model
2026-Aug, European heart journal. Imaging methods and practice
DOI:10.1093/ehjimp/qyag125
PMID:42500508
|
研究论文 | 本研究旨在验证从4D血流CMR幅度图像中提取的解剖信息的准确性,并开发用于自动分割的深度学习模型,以实现心脏结构和功能的全面评估 | 首次验证了4D血流序列的幅度图像在提供准确容积测量方面的潜力,并开发了全自动深度学习模型用于分割,简化了传统复杂的后处理流程 | 样本量较小(n=40),且为单中心研究,可能限制结果的普遍性 | 验证4D血流幅度图像在心脏容积学上的准确性,并开发自动化AI模型以促进心脏结构和血流动力学的分析 | 心脏腔室(左心室、右心室、左心房、右心房)及大血管 | 医学影像分析 | 心血管疾病 | 4D血流心血管磁共振 | 深度学习分割模型 | 医学图像(4D血流幅度图像及标准电影序列) | 40名患者 | NA | NA | Dice相似系数, 相关系数, 组内相关系数, 峰值指标相关度 | NA |
| 1093 | 2026-08-24 |
Generative chromoendoscopy for gastric neoplasms: a multicenter prospective study
2026-Aug, Endoscopy
IF:11.5Q1
DOI:10.1055/a-2873-4466
PMID:42103307
|
研究论文 | 本研究为多中心前瞻性研究,评估基于深度学习的生成式色素内镜在胃癌前病变和早期胃癌可视化中的临床可行性 | 首次将深度学习合成图像转换技术应用于实时内镜,生成生成式色素内镜图像以改善胃肿瘤的可视性 | 样本量较小(60例),可能影响统计功效;研究时间跨度短,未涉及长期随访结果 | 验证生成式色素内镜在改善胃肿瘤可视性方面的临床可行性,并比较其与传统白光成像和真实色素内镜的效果 | 早期胃癌或腺瘤患者 | 医学影像分析 | 胃肿瘤 | 深度学习合成图像转换 | 深度神经网络 | 内镜图像 | 60例患者 | NA | NA | 可视性评分(7点Likert量表) | NA |
| 1094 | 2026-08-24 |
STL-DeepBDC: A Robust Few-Shot Learning Framework for Multiclass Ovarian Tumor Classification in Ultrasound Outperforms Conventional Transfer Learning
2026-Aug, Cancer medicine
IF:2.9Q2
DOI:10.1002/cam4.72165
PMID:42624791
|
研究论文 | 本研究开发并评估了一种基于分层迁移学习和深度双线性判别协方差模块的少样本深度学习框架STL-DeepBDC,用于超声图像中卵巢肿瘤的多分类,其性能优于传统迁移学习方法 | 将分层迁移学习与深度双线性判别协方差模块相结合,提出STL-DeepBDC框架,在有限样本条件下实现卵巢肿瘤的稳健多分类,并通过Grad-CAM提供可解释性 | 单中心回顾性研究,需要更大规模的多中心外部验证研究才能支持临床应用 | 在少样本条件下,开发一种稳健且可解释的深度学习框架,用于超声图像中卵巢肿瘤的术前多分类,以支持手术规划和预后判断 | 经手术和病理确诊的恶性及交界性卵巢肿瘤患者的超声图像,涵盖六种病理类型 | 医学影像分析 | 卵巢肿瘤 | 超声成像 | 卷积神经网络 | 超声图像 | 2017年8月至2022年10月期间治疗的卵巢肿瘤患者超声图像,按5:3:2比例分为训练、验证和测试集 | PyTorch | ConvNeXt, DeepBDC | 准确率, 敏感性, 特异性, macro-F1分数, AUC, AUPRC, Grad-CAM | NA |
| 1095 | 2026-08-24 |
Artificial Intelligence-Driven Multimodal Prediction of 10-Year Incident Glaucoma Integrating Genetic and Deep Learning-Derived Imaging Features
2026-Aug, Ophthalmology science
IF:3.2Q1
DOI:10.1016/j.xops.2026.101292
PMID:42495699
|
研究论文 | 本研究开发了一种多模态机器学习框架,整合遗传和深度学习衍生的成像特征,用于预测10年内原发性开角型青光眼的发病风险 | 首次将深度学习衍生的眼底图像特征与多基因风险评分、眼部测量等五个特征域整合,实现高准确度和可解释性的青光眼发病预测 | 未提及 | 开发并验证一种可解释的多模态机器学习框架,用于准确预测10年内原发性开角型青光眼的发病风险 | 英国生物银行参与者,包括严格定义的原发性开角型青光眼队列(340例病例和9374例对照)和广义定义队列(1241例病例和34216例对照) | 机器学习 | 青光眼 | 眼底图像分析、多基因风险评分、电子健康记录分析 | XGBoost | 图像、遗传数据、临床数据 | 严格定义队列:340例病例和9374例对照;广义定义队列:1241例病例和34216例对照 | NA | XGBoost | AUC, 敏感性, 特异性, Brier分数 | NA |
| 1096 | 2026-08-24 |
Toward comprehensive cellular characterization of H&E slides
2026-Aug, Journal of pathology informatics
DOI:10.1016/j.jpi.2026.100696
PMID:42633338
|
研究论文 | 介绍HistoPLUS模型,用于H&E切片中细胞检测、分割和分类,在泛癌数据集上训练,性能优于现有方法 | 提出HistoPLUS,基于包含108,722个细胞核、13种细胞类型的新型泛癌数据集,在检测质量和F1分数上显著优于现有模型,且参数减少5倍,并实现领域迁移 | 未明确提及局限性 | 改善H&E切片中细胞分析的性能,尤其是对罕见细胞类型的检测和跨域泛化 | 肿瘤微环境中的细胞,包括13种细胞类型,共108,722个细胞核 | 数字病理学 | 多种癌症(泛癌) | H&E染色 | 深度学习模型 | 病理图像 | 108,722个细胞核,13种细胞类型,4个外部验证队列 | NA | HistoPLUS | 检测质量(Detection quality)、F1分数 | NA |
| 1097 | 2026-08-24 |
Comparing the Performance of Foundation Model Derived Embeddings with Traditional Approaches for Distant Metastasis Prediction in Head and Neck Cancer
2026-Jul-28, ArXiv
PMID:42619875
|
研究论文 | 本研究比较了基于基础模型提取的特征与传统方法在预测头颈癌远处转移风险中的性能,发现基础模型特征具有优越性并减少了对专业知识的依赖。 | 首次在头颈癌远处转移预测中评估医学影像基础模型作为特征提取器的效果,无需先验区域知识或分割标注,简化了预处理流程。 | 未提及具体局限性,但可能包括对基础模型特征可解释性的不足或依赖单一数据集。 | 评估使用基础模型从最小处理的CT图像中提取特征预测头颈癌远处转移风险的有效性,并与传统方法(如放射组学和深度学习特征)进行比较。 | 头颈癌患者的术前CT图像及其远处转移风险。 | 医学影像分析 | 头颈癌 | CT成像 | 多层感知机(MLP) | 医学影像(CT图像) | 2327例患者(来自RADCURE数据集) | 未提及 | 基础模型(CT Foundation)、放射组学特征提取、深度学习特征提取器 | AUC | 未提及 |
| 1098 | 2026-08-24 |
A deep learning approach for predicting antimicrobial resistance in urinary tract infections
2026-Jul-28, BMC urology
IF:1.7Q3
DOI:10.1186/s12894-026-02203-4
PMID:42625161
|
研究论文 | 本研究利用深度学习方法预测尿路感染中的抗生素耐药性,通过比较多种特征提取和分类方法,实现了对耐药尿路感染病例的早期预测 | 提出了基于分数阶离散余弦分解方法(FrdcDM)的新型特征提取技术,并结合双向长短期记忆网络(BILSTM)进行耐药性预测,该方法在多个独立数据库上表现出较高的准确率和AUC值 | 未明确提及研究的局限性 | 旨在通过合适的机器学习分类器早期预测尿路感染中的药物耐药性,以辅助医生选择正确的治疗方案并改善患者健康 | 尿路感染患者的耐药性状态,包括药物耐药(DR)和多药耐药(MDR)情况 | 机器学习 | 尿路感染 | NA | BILSTM, 逻辑回归, 梯度提升分类器 | 结构化临床数据(来自三个数据库) | 三个数据库:埃及亚历山大大学医院、菲律宾北棉兰老岛普通诊所、也门IBB大学Al-Rafa实验室的UTI患者数据 | NA | BILSTM, 逻辑回归, 梯度提升(未指定具体架构) | 准确率, AUC | NA |
| 1099 | 2026-08-24 |
Dynamic beat-to-beat blood pressure estimation using a multi-modal wearable deep learning approach
2026-Jul-27, Physiological measurement
IF:2.3Q3
DOI:10.1088/1361-6579/ae85b4
PMID:42392163
|
研究论文 | 本研究提出一种结合浅表颞动脉张力测量、心电图和光电容积脉搏波的多模态深度学习框架,用于动态逐搏血压估计 | 创新性地融合了张力测量法获取的压力波形形态与血流动力学时序特征,克服传统PTT方法依赖血容量替代物导致的校准漂移问题 | 研究仅在10名健康志愿者中进行,样本量有限,未涉及患者群体或更广泛人群验证 | 开发一种无需袖带、校准稳健的连续血压估计方法 | 10名健康志愿者在等长握力运动中的血压及相关信号 | 可穿戴设备, 深度学习 | 不适用 | 张力测量法, 心电图, 光电容积脉搏波 | 时间卷积网络 | 生理信号(心电图、光电容积脉搏波、张力测量波形) | 10名健康志愿者,29条记录 | NA | TCN | 平均绝对误差 | NA |
| 1100 | 2026-08-24 |
A fine-grained defect-sensitive local-global multiscale vision transformer framework for urban visual pollution prediction
2026-Jul-24, Scientific reports
IF:3.8Q1
DOI:10.1038/s41598-026-63974-2
PMID:42624864
|
研究论文 | 提出一种基于Transformer的细粒度缺陷敏感局部-全局多尺度视觉转换器框架,用于街道图像中的城市视觉污染多类检测和严重程度量化 | 集成细粒度城市补丁编码、缺陷敏感特征增强、局部-全局双分支学习、层次化特征融合和可学习的视觉污染指数层,以量化退化严重程度 | 未在摘要中明确说明局限性 | 解决现有视觉污染评估方法对细节退化模式敏感性有限、上下文理解不足和连续环境严重程度评估能力差的问题,实现大规模城市视觉污染监测和智慧城市环境管理 | 街道级图像数据中的七类城市视觉污染类别,包括垃圾、涂鸦、坑洼、施工道路损坏和人行道杂乱 | 计算机视觉 | 不适用 | NA | 视觉Transformer | 图像 | 未在摘要中明确说明样本数量 | NA | 多尺度视觉Transformer | 准确率、精确率、召回率、F1分数、视觉污染指数得分 | 未在摘要中明确说明计算资源 |