子锐
博客 / 论文解读 / 杂谈随记 / 关于我
  • 2026年3月16日
    论文简读:《One Flight Over the Gap: A Survey from Perspective to Panoramic Vision》 这篇综述总结了全景任务的三个主要挑战:极地附近的几何畸变、等矩形投影中的非均匀采样和全景边界的周期性连续性。文章将全景研究分为四个方向:视觉质量增强与评估、视觉理解、多模态理解和视觉生成。针对全景分割的挑战,提出了畸变感知方法和投影驱动方法,并讨论了多个全景任务,如反射去除、视觉质量评估和布局检测等。 【阅读笔记】
  • 2026年1月12日
    论文简读:《CenterNet: Keypoint Triplets for Object Detection》 这篇 CenterNet(Keypoint Triplets)通过在 CornerNet 的角点检测上引入“中心点一致性”约束,并用 center pooling 与 cascade corner pooling 把边界与内部语义显式揉进关键点表示,从而解决角点配对歧义,但代价是引入了强方向性先验,对旋转与非轴对齐目标不友好。 【阅读笔记】
  • 2025年12月25日
    论文简读:《InfoSAM: Fine-Tuning the Segment Anything Model from An Information-Theoretic Perspective》 文章探讨了如何从信息论的角度微调Segment Anything Model,提出通过设计Loss和Relation Module提取领域不变关系,以避免特定任务微调覆盖原有视觉特征。通过最大化互信息和设计蒸馏结构,文章有效地转移提取的信息,强调了Relation Module在提取不变特征中的重要性。 【阅读笔记】
  • 2025年12月22日 精读
    论文精读:《SAM 3: Segment Anything with Concepts》 SAM3 详解:在SAM2的基础上重新设计了结构,支持Promptable Concept Segmentation (PCS)任务,允许通过简单名词短语和图像示例对目标进行标注和追踪。模型采用了META的Perception Encoder,结合了双重监督和Align loss来提高准确性。尽管技术上有进步,但整体感觉不如SAM2惊艳,更多是工程上的改进。 【阅读笔记】
  • 2025年12月10日 精读
    论文精读:《SAM 2: Segment Anything in Images and Videos》 SAM2 详解:提出了可控视觉分割(PVS)任务,允许在视频的任意帧上提供提示以进行对象分割。与SAM相比,SAM2更专注于视频中的连续分割,采用了内存库和记忆注意力模块来传播帧间的分割结果。通过与标注员的交互式标记生成训练数据,SAM2在视频分割精度和效率上显著提升,最终SA-V数据集包含35.5万个掩码,覆盖50.9千个视频,表现优于现有模型。 【阅读笔记】
  • 2025年12月8日
    论文简读:《ChangeDINO: DINOv3-Driven Building Change Detection in Optical Remote Sensing Imagery》 介绍了论文提出的一种端到端的多尺度Siamese框架,包含DINOv3预训练编码器、密集特征融合模块、空间-光谱差分Transformer解码器和可学习形态学模块。该框架通过不同时间的特征相减进行遥感变化检测,优化传统算法以生成更精细的掩膜。消融实验显示,去掉其他模块后,仅使用DINO特征在LEVIR-CD上的效果依然良好,表明DINO的有效性。 【阅读笔记】
·
由子锐设计
浙ICP备2022026813号-1