最新 最热

南洋理工提出 Nested-TNT,提升 Transformer 效率,在视觉识别任务中的性能飞跃 !

Transformer的诞生[23]开启了大型模型的时代,并加速了自然语言处理领域的发展。Transformer的提出解决了传统卷积神经网络(CNNs)[1]在捕捉全局特征方面的不足,并提高了模型的泛化能力。与传统的循环神经网络相比,Transform...

2024-08-08
22

无需训练,kNN-CLIP 在图像分割中的应用 !

在图像分割领域,圣杯是能够基于文本 Query 准确分割任意概念图像。随着视觉-语言模型(VLMs)如CLIP的迅速发展,这一任务变得更加可行。当这些模型应用于语义和全景分割时,显示出在处理广泛的视觉数据词汇方面的潜力。然而,尽...

2024-08-08
20

卡内基梅隆大学 & 微软研究院引入 Med-VTAB 用通用预训练权重提高ViTs在视觉任务上性能 !

深度学习最近的进展极大地推动了计算机视觉领域的发展,尤其是引入了视觉 Transformer (ViTs)。这些模型一旦在大规模数据集上预训练,就已在广泛的视觉任务中展示了卓越的能力。通过特殊的学习层或 Token 等机制,ViTs能够适...

2024-08-08
17

无需相机信息,UniDepth 自提示相机模块,仅从单一图像跨领域重建度量3D场景 !

精确的逐像素深度估计对于理解几何场景结构至关重要,其应用包括3D建模[10]、机器人学[11, 63]和自动驾驶车辆[38, 51]。然而,为了有效地进行3D重建,提供可靠的度量尺度深度输出是必要的,这促使了单目度量深度估计(MMDE)这一...

2024-08-08
5

MIT & Caltech & AWS 提出 ALDI,目标检测新突破, 超越现有方法,再次刷新 SOTA!

ALDI++ 在 Cityscapes Foggy Cityscapes 上的AP50超过了先前最先进的方法+3.5,在 Sim10k Cityscapes 上超过了+5.7 AP50(作者的方法是唯一一种超过公正基准线的方法),在 CFC Kenai Channel 上超过了+2.0 AP50。作者的...

2024-08-08
19

腾讯云AI代码助手:智能编程的未来之窗

今天七七给大家带来一款非常好用的辅助编程工具,“腾讯云 AI 代码助手”,它是一款定位代码智能补全和生成的工具,基于自研代码大模型,实现技术沟通、代码补全、自动补全单元测试等功能。在当今数字化高速发展的时代,编程领...

2024-08-08
19

UP-DETR 无需人工标注,随机裁剪多个 Query Patch ,并预训练 Transformer 进行目标检测 !

DETR是一种最近的框架,它将目标检测视为一个通过 Transformer 编码器-解码器[2]直接预测集合的问题。在没有手动设计的样本选择[3]和非最大值抑制(NMS)的情况下,DETR甚至可以达到与Faster R-CNN[4]相竞争的性能。然而,DETR...

2024-08-08
18

暗场景下的视觉突破:ECAFormer提升低光照图像增强性能 !

在低光照条件下捕捉图像常常会导致各种摄影挑战,如细节数据丢失、色彩强度降低、对比度和动态范围减小以及曝光不均。这些问题会降低视觉数据的质量和清晰度,进而显著阻碍后续基于视觉的任务。例如,它们可能妨碍自动驾驶...

2024-08-08
6

视频真伪难辨?蚂蚁集团 & 南大 & 上交通开源 DeMamba 即插即用,助你一臂之力 !

生成模型的进展令人印象深刻,使得创建高度逼真的图像变得更加轻松且无需专业知识。随着这些模型能够生成足够逼真的图像,越来越多的研究者探索如何改进视频创作。目前,某些生成算法,如Sora(Brooks等人,2024)和Gen2(Research,20...

2024-08-08
10

提升CLIP性能,IntCoOp联合学习在零样本学习中的优势 !

近年来,在视觉语言模型领域取得了重大进展,例如CLIP、Flamingo 、ALIGN 和CoCa。这些模型通过结合两个基本组成部分,在获取可迁移且鲁棒的图像表示方面取得了卓越成就:...

2024-08-08
9