论文阅读笔记-图像超分与复原

阅读一系列论文时的笔记。

和导师沟通后,确定了小方向走图像超分/复原这条路。于是开始读该领域的一系列论文。

CVPR 2024 超分辨率(Super-Resolution)论文汇总 - 知乎

CVPR 2024 | 图像超分、图像恢复汇总!用AIGC扩散模型diffusion来解决图像low-level任务的思路 - 知乎

DiffIR:用于图像恢复的高效Diffusion模型 - 知乎

ICCV 2023 | 9篇论文看扩散模型diffusion用于图像恢复任务:超分、恢复、增强、去模糊、去阴影 - 知乎

论文阅读基于Stable Diffusion的图像超分 - 知乎

ECCV2024|底层视觉(超分辨率,图像恢复,去雨,去雾,去模糊,去噪等)相关论文汇总(附论文链接/开源代码)【持续更新】_smfanet: a lightweight self-modulation feature agg-CSDN博客

StableSR

Residual Feature Aggregation Network for Image Super-Resolution

Image Processing GNN: Breaking Rigidity in Super-Resolution

CVPR 2024

摘要

超分领域传统的神经网络和窗口注意方法要求比较严格,这两种操作中,每个像素收集相同数量的相邻像素,这阻碍了它们在SR任务中的有效性。

该论文利用图的灵活性,提出了图像处理GNN(IPG)模型

通过为细节丰富的图像节点分配更高的节点度来利用度的灵活性。然后,为了构造SR有效聚集图,我们将图像视为 pixel node sets 而不是 patch nodes。

最后,为了采集局部信息和全局信息,需要灵活地从局部和全局两个尺度上有效地收集像素信息,我们在邻近区域内寻找节点连接以构造局部图;在整个图像的一个步长采样空间内寻找连接,构造全局图。

图的灵活性提高了IPG模型的SR性能。不同数据集的实验结果表明,IPG优于baseline。

一、介绍

主流SR模型以相当严格的方式处理所有像素是理所当然的。例如,基于CNN的SR模型VDSR的卷积层中,相同的卷积核扫描特征图的所有像素,即,每个像素被严格指定为与其最近的邻居通信;在基于Transformer的模型SwinIR 中,所有像素被分配到相等大小的 attention grids 以进行 self-attention 操作。

最近的一些SR研究试图通过扩大 self-attention grids 和设计条纹全局注意窗口来增强SR模型。但是这些改进也引入了很大的计算负担。

其他一些工作利用了图的灵活性,并提出了基于图的方法。利用基于内容的图构造图块节点,在卷积和窗口注意中,每个图像块可以聚集硬局部边界之外的top-k个相关但距离较远的部分

现有的基于k-最近邻图的方法平等地对待所有图像节点。换句话说,所有节点共享相同的预设度k,不考虑SR的不平衡性质。事实上,当我们从图形的角度检查SR中的规范操作范例时,我们发现“度等价”这一特点体现在卷积和窗口注意力中:在这些范例中,图像上的每个像素聚合相同数量的像素,而不管图像内容如何,因此,在图论中共享“相等的度”(每个像素块的 度 是一样的)。这也意味着这些方法的僵化。严格分配给节点或像素的相等节点度与SR中的不相等重建需求不匹配,从而影响SR性能。

问题:基于Transformer的改进引入了很大的计算负担。而原有的基于图的方法较为僵化,与 SR 中的不相等重建需求不匹配。

二、相关工作

图与视觉:图已广泛应用于视觉任务,包括点云分割,人类动作识别[42]和图像分类。以前的一些 low-level 工作也将图像视为图。大多数工作会利用图来聚合非局部信息,无论是 intra-scale 还是 cross-scale。图上的其他low-level vision work 包括跨层 cross-layer或图像间信息聚合inter-image information aggregation。在这些 work中,从相邻节点的边缘条件聚合是最优选的。

在从图像构建图方面,大多数工作使用k-最近邻。由于所有图像节点都具有相同的度,KNN图不够灵活;且在low-level vision task中图像节点的不平衡性也被忽视。此外,大多数graph工作将 patches 视为image nodes,忽略了low-level问题中潜在的 patch 未对齐问题。至于图的规模,一些工作在全局范围内搜索以构造图;其他工作从局部框构造图。这些作品中的图不够灵活,因为它们未能兼顾局部和全局方面。

三、方法

卷积和窗口注意力是 SR 的两个主要途径。尽管在SR中使用得很普遍,但并不灵活。它们根深蒂固的僵化可能会阻碍SR的性能。在一个卷积运算中,每个输出像素在一个微小的 kernel 大小的窗口内收集信息;每个像素只能访问其相邻像素。例如,在标准的3 × 3卷积中,单个像素的感知场被限制在一个微小的3 × 3框中。图像上的所有像素从8个相应的邻居和它们自己收集信息。类似的僵化也适用于窗口注意力:尽管通常采用更大的窗口大小(与卷积相比),但窗口注意力的感知范围仍然局限于硬窗口边界内。在一个8 × 8窗口注意场景中,所有像素在它们所属的窗口内聚集64个像素。

因此,除了卷积和窗口注意力机制的僵化之外,一些工作跳出固有思维,在 SR 模型中采用图Graph。与信息聚合受限于框的卷积和窗口注意不同,这些基于图的工作在空间上更加灵活:每个节点都可以从其最喜欢的前 k 个节点聚合信息。因此,图不限于预设的僵化。与卷积和窗口注意力机制相比,它更具动态性和可扩展性。

已有的基于图的方法突破了硬聚合边界,但图的灵活性在SR任务中没有得到充分的利用。SR重建需求在不同图像部分之间不平衡。问题包括:

  1. 先前的方法中,图像上的所有像素pixels节点nodes聚合相同数量的像素或节点:即,它们共享相同的度。
  2. 先前基于图的作品都是 patch-rigid 的。虽然 patch 通常被视为图像节点nodes,但 patch 聚合通常需要严格的像素对齐。patch 中可能存在的 low-level 特征错位会使SR模型的性能变差。
  3. 以往的基于图的工作,要么使用全局上的图,要么使用局部尺度上的图,但实际上这两个尺度上的信息对于SR重构都是潜在重要的。这些僵化的方面正在阻碍SR模型的性能。

不同方法间“度”的对比

论文中图的构建:

在IPG模型的局部和全局尺度上构建了度灵活的像素图。通过这种方式,我们可以充分利用图的灵活性,并在SR任务中获得出色的性能。

度的灵活性:首先,基于SR任务的“不平衡性”,提出了一种 “degree-flexible” 的求解方法。SR重建图像特征不平衡。SR是一个长尾问题,其中只有一小部分高频像素需要重建,其余图像部分只需要最小限度的恢复。然而,许多工作通过设计训练损失来解决这个问题,而不是从模型设计的角度重新思考。在不平衡的超分问题中,等效处理图像上的所有或部分像素是不适宜的、效率低下的。而这个问题长期被忽视。

我们选择基于标记需要更多重建工作的像素的细节丰富的指示符来为像素分配各种节点度。

具体而言,给定特征图 $F∈R^{H×W×C}$ ,下采样率 s。

每个像素的细节丰富度量指标为$D_F ∈ R^{H×W}$ 指定为双线性下采样和上采样特征图与特征图本身之间的绝对差:
$$
D_F:=\sum_C|F-F_{\downarrow s\uparrow s}|
$$
s 取为2以避免严重的信息丢失(? )。一些可解释的SR作品提出了度量输出中某个部分的重要性的指标。然而,这些措施是基于梯度的,这需要昂贵的backward。相比之下,所提出的度量$D_F$是成本低的,因为它只需要两次双线性插值两次。我们还在附录中提供了FLOPs统计数据。(FLOPs,floating point operations,浮点运算数,理解为计算量。可以用来衡量算法/模型的复杂度。)

在 $D_F$ 的基础上,整体度的预算会分配给每个像素。特征图上的像素节点 $v∈F$ 的度与其在 $D_F$ 处的对应像素值成比例:$deg (v) ∝ D_F (v)$ 。细节丰富度指标 $D_F$ 是可视化的。可以看出的是,边缘和角落具有高$D_F$,而平坦色块的$D_F$较低。可视化结果表明,该方法能够有效地将图像中的高频部分反映到各层中。

像素节点灵活性: 我们面对的是图中顶点的公式化。在以前的基于图的视觉工作中,图节点通常被设置为图像块 patches 。在图形聚合期间,以逐像素方式对像素块 patches 进行加权求和。然而,在聚合期间像素的强制元素对齐不适合特征图具有丰富的 low-level 特征的SR任务。low-level任务中的对象移动和旋转是导致 patch 未对齐的两个主要问题。至于对象移位shift,对象在 patch 内的位置可能会有所不同;位置未对齐的 patch 对象会引入噪声。对象旋转是 patch 聚合的另一个错误方面。由于 patch 对齐期间 patch 形状为刚性矩形,因此 patch 的方向总会被忽略。

为了避免节点聚合过程中出现上述问题,我们认为在 low-level 场景中更细粒度(finer-grained)的像素节点是更好的解决方案。像素图更加灵活:每个像素节点可以直接在聚合中找到它的相关像素,从而避免了像素错位。

与 pixel graph 相比,patch graph可能具有更大的感知域,且由于节点总数更少而更容易构造,这意味着用于边连接的搜索空间更小。因此,我们需要一种有效的方法来构造一个灵活有效的 pixel graph。

空间灵活性: 我们通过局部和全局像素节点连接的有效搜索来开发 IPG 图的空间灵活性。我们提出局部和全局信息对于SR重建都是至关重要的:虽然有损图像部分可以从局部邻域中重建自己,但它们也可以从遥远但相似的特征中学习以进行细化。

现有的基于图的方法已经展示了某种空间灵活性。如图所示,与卷积和窗口关注选项(像素始终关注固定的相邻区域)相比,图聚合可以灵活地关注关键图像部分,而不受空间限制。然而,现有的基于图的方法在空间上不够灵活,不能兼顾局部和全局的特点。

实际上,计算考虑是连接搜索的主要关注点。通过搜索所有图像节点来构造全局图的代价很高。作为一种补救措施,通常采用步长采样(stride sampling)。但结果是,局部区域 local regions 被忽视了。像素作为图节点的选择使得图构造更加具有挑战性,因为节点空间被进一步扩大,并且搜索所有像素以用于图构造几乎是不切实际的。

为了提高效率,并收集有助于SR任务中细节重建的局部周围特征和全局远距离特征,我们使用两种类型的采样来聚合局部和全局信息:对于局部采样,选择某个节点周围的邻域作为局部尺度的搜索空间,在其上建立图;对于全局采样,采样节点 sampled nodes 以扩张的模式跨越整个图像。

现在构建了灵活的图,执行图聚合,使得每个节点可以与其连接的邻居进行通信,并使用它们的信息在SR中进行自细化。在图的视觉应用中,最大池化 aggregation in max-pooling 或边条件形式的聚合 edge-conditioned 是最优选的。我们倾向于采用边缘调节聚合,因为最大值合并可能会导致相邻像素的信息大量丢失,而这些信息对低级视觉至关重要。由于超分辨率图像的像素重建依赖于丰富的邻域信息,采用边缘条件聚合算法,既考虑了像素间的相互关系,又保留了更多的邻域信息,以保证重建的有效性。

边缘条件聚合算法数学语言表达如下:在IPG中的第 $k$ 层,给定节点特征$h^{k-1}$作为输入,相邻节点集合$N(v)$,节点v输出$h^k_v$计算为:
$$
h^k_v=\frac{1}{C^k}\sum_{v\in N(v)}exp(f^k(u,v))h^{k-1}v
$$
其中$f^k:R^d × R^d → R$是衡量节点对 (u,v) 之间相关性的参数化函数;$C^k:=\sum
{v\in N(v)}exp(f^k(u,v))h^{k-1}_v$ 是归一化常数。例子中,余弦相似性被采用作为相关性度量。

尽管图聚合具有灵活性,但我们担心在图聚合过程中空间信息会被破坏:由于所有节点都被平等对待,模型将掌握很少的节点位置知识。因此,受Liu等人的启发。在聚合之前向节点特征添加相对位置编码以增强位置信息。

模型的结构

团队将所提出的图构造和图聚合机制作为 IPG模型合并到有效的 MetaFormer 架构中。IPG的详细结构如图所示。

IPG结构

IPG架构。IPG的总体架构遵循主流SR模型。当LR图像 (低分辨率图像) 被输入到模型中时,它首先被传递到Conv Layer以提取浅层特征。然后将特征通过一系列的多尺度图聚合块 (Multiscale Graph-aggregation Blocks ,MGB),利用 flexible graph 进行有效的深度特征提取。每个MGB由图聚合层 (Graph Aggregation Layer,GAL) 组成,其在本地和全局尺度上执行图聚合。最后,通过像素混淆上采样器对图像进行空间重构。

MGB 块。多尺度图聚合块(MGB)同时收集局部和全局尺度的信息,实现有效的图像SR重建。局部和全局像素图都是基于块输入按块计算的。逐块图计算可在整个模型中定期更新图形。构造步骤详见3.2节,分别进行局部采样和全局采样,进行局部或全局图构造。然后,将两种类型的图(局部/全局)分布到整个块中的GAL以进行聚合操作。局部和全局图以顺序交替的方式分布,以确保局部和全局尺度的信息都被充分地聚合。

GAL层。图形聚合层(GAL)的设计遵循一般的类MetaFormer结构[44]。负责图聚合(如3.3节中所介绍的)的 Graphers 被用作 token混合器。Grapher 根据收到的图类型收集局部或全局信息。接下来,我们利用高效的通道注意力 (Coordinate Attention,CA) 模块和 ConvFFN 块来提高我们模型的 SR 性能。

四、实验部分

采用最近SR工作[5,6,23]中的一般训练设置,以进行公平比较。我们使用DIV2K+Flickr2K($D_F$2K)作为训练集(DIV2K用于轻量级模型)。将尺寸为64 × 64的裁剪 patches 送到模型中。训练数据通过随机翻转和随机旋转角度[0,90,180,270]来扩充。

使用Adam Optimizer(β1 = 0.9,β2 = 0.99)以2e−4的学习速率训练 500K 次迭代。训练输入大小设定为64 × 64。采用 MultistepLR ,其中 lr 在迭代[250000,400000,450000,475000]时减半。批处理大小设置为32。

优化器 Adam,0.9 ,0.99

学习率 2e-4

iters 500000

batch_size 32

实验表现:

比较了我们的模型与表1中Set 5 [3],Set 14 [45],BSDS 100 [33],Urban 100 [13]和Manga 109 [34]基准的各种SR baseline的性能。选择的 baseline 如下:IGNN 是基于 patches 图的SR方法; ELAN ,IPT ,SwinIR ,CAT-A,ART ,GRL-B 和 HAT是基于 Transformer 的方法。通过PSNR和SSIM测试了SR ×2、×3、×4模型的性能。“+”标记代表具有自集成策略的 baseline ,这进一步提高了SR性能。IPG可以大幅超越其他模型。特别是,IPG在Urban100 × 4任务上达到 28.13dB 的PSNR,在标准训练设置下超过现有SOTA 0.1dB以上。IPG在PSNR与理论FLOPs图中具有出色的性能,如图5所示。但值得注意的是,由于缺乏硬件支持,IPG 的运行速度比以前的方法慢;IPG 占用的峰值内存略有优势。除了 PSNR/SSIM 指标的定量比较外,我们还提供了 IPG 重建的困难细节的视觉结果。如图 6 所示,在 SR ×4 任务上,将提出的 IPG 模型与最近的顶级 SR baseline进行了比较。我们的 IPG 模型在视觉上可以胜过其他方法。

还提供了IPG的一些轻量化变体。虽然IPG-S和IPG-Tiny的架构与基础版本保持相同,但其深度和尺寸宽度对于计算受限的应用程序而言显著降低。变体配置详情见附录。我们选择了规范的SR baseline,包括 CARN[1]、IMDN [14]、LAPAR-A [19]、LatticeNet [31]和ESRT [30];其他 baseline采用MetaFormer架构,包括SwinIR-light [23]、ELAN [48]、SwinIRNG [53]和SRFormer-light [53]。IPG可以以相似的计算成本胜过共享相似MetaFormer [44]架构的SR baseline。具体而言,与其他轻量级基准相比,IPG-Tiny在Urban 100上实现了超过0.1dB的PSNR改善。

消融实验

Pixel Nodes vs. Patch Nodes:如第3.2节所述,作为图像图形节点的 patches 可能会在对象移动和对象旋转等情况下受到影响。 patches 像素的强制逐元素对齐会在很大程度上阻碍SR性能。为了研究 patches 节点的负面影响,我们提供了一个修补版本的IPG如下:不使用像素节点,使用2 × 2大小的 patches 作为节点在这个修补的变体。为了公平比较,其他模型设置保持不变,包括模型深度、特征尺寸、MLP比率和采样区域大小。然而,我们知道,与像素节点相比, patches 节点聚合的计算成本可能不同。因此,我们调整 patches 变量的聚合次数,以确保 patches 节点的聚合具有与像素节点聚合相似的成本。消融结果如表2所示。

对于使用大 patches 作为节点的IGNN, patches 对齐带来了麻烦:模型对纹理方向感到困惑,因此在纹理重建过程中对齐模式相似但方向不同的 patches 会出错。对于修补的IPG,未对齐的方向也会导致问题:线纹理扭曲。相比之下,IPG中的像素聚合避免了未对准并且表现良好。

KNN:在视觉任务的典型图形应用中,通常采用 k-最近邻 (KNN) 图来构建图形。然而,由于所有节点都连接到固定数量的邻居节点,KNN仍然受到度 rigidity 的影响。为了提高度的灵活性,我们考虑了SR任务中像素需求的不平衡性,提出了一种度灵活的图构造方案(在3.2节中介绍)。我们在相同的设置下,比较了KNN和度灵活图方案在IPG中的性能。根据表3,Degree-Flex可以胜过IPG的KNN变体。有趣的是,我们的Degree-Flex图可以胜过计算量大的全连接图(见附录),这进一步表明了我们的DegreeFlex图的有效性。

如图8所示,在局部尺度上直观地比较了细节贫乏像素和细节丰富像素的连通区域。细节不佳的像素通常位于图像的平坦、不变部分;这些像素需要最少的节点连接进行重建。相反,细节丰富的像素节点通常位于边缘和角上,这些边缘和角被分配了较高的节点度,从而具有较大的感知区域。在这个意义上,细节丰富的指标度量$D_F$可以赋予IPG程度灵活性.

局部/全局图:在 IPG 的设计中,我们基于局部和全局像素节点采样从局部和全局尺度聚合信息。尽管许多 SR 工作都强调了局部或非局部聚合的重要性,但我们证明这两个方面对于 SR 性能实际上都至关重要。我们仅在相同的设置下使用局部或全局比例图进行实验,并将其与IPG的原始版本进行比较。当局部和全局聚合都进行时,可以达到最佳性能。

五、总结

现有的SR测度在空间和度上都是 rigid 的。为了打破SR的僵化,提出了IPG –一种充分利用图的灵活性的SR模型。首先,我们知道,SR是一项任务,其中细节丰富的图像部分需要不平衡的重建工作。因此,我们设计了一个度可变的图构造方案,而不是k-最近邻。然后,我们采用像素而不是 patches 来进行图聚合。为了达到最大的空间灵活性,节点在局部和全局尺度上都被采样。与SR基线相比,IPG达到了最先进的性能。

SeD: Semantic-Aware Discriminator for Image Super-Resolution

CVPR 2024

摘要

生成对抗网络(Generative Adversarial Networks,GANs)可广泛应用于图像超分辨率(SuperResolution,简称SR)中的纹理恢复。具体地,利用判别器,使得SR网络能够以对抗训练的方式学习真实世界的高质量图像的分布。然而,分布学习过于粗粒度,容易受到虚拟纹理的影响,并导致违反直觉的生成结果。

为缓解这一问题,我们提出了一种简单有效的语义感知鉴别器(Semantic-aware Discriminator,简称为SeD),它通过引入图像的语义作为条件,促使SR网络学习图像的细粒度分布。具体地说,我们的目标是从一个经过良好训练的语义提取器中挖掘图像的语义。在不同语义下,鉴别器能够自适应地对真假图像进行区分,从而指导SR网络学习更细粒度的语义感知纹理。为了获得准确和丰富的语义,我们充分利用了最近流行的具有大量数据集的预训练视觉模型(PVMs),然后通过设计良好的空间交叉注意模块将其语义特征融入到鉴别器中。通过这种方式,我们提出的语义识别器使SR网络能够产生更逼真和令人愉快的图像。在两个典型的任务上进行了广泛的实验,仿真结果验证了所提方法的有效性。

一、介绍

深度学习加速了单图像超分辨率(SISR)的巨大发展,其目的是从退化的低分辨率(LR)图像中恢复生动的高分辨率(HR)图像。

SISR追求的目标有两个,即:客观和主观质量。为了追求更高的客观质量,已经提出了一系列基于CNN,Transformer 的框架,以通过逐像素损失函数的约束来提高SR网络的表示能力(例如,L1损失和MSE损失)。

但逐像素损失函数不能使SR网络具有有希望的生成能力,这使得这些方法在纹理生成上表现不佳,且主观质量也不好。

为了提高图像的主观质量,需要对失真图像生成令人愉悦的纹理。受生成对抗网络 GAN 的启发,许多工作将SR网络作为生成器,然后引入鉴别器,使SR网络具有真实感知纹理生成能力。SR网络有三种典型的判别器: 逐图像鉴别器 image-wise discriminator、逐拼贴元鉴别器 patch-wise discriminator 、逐像素鉴别器 pixel-wise discriminator。具体地,图像式鉴别器的目的是从全局分布中区分真实/假图像,如VGG样鉴别器。但一般来说,图像方式的分布是粗粒度的,使得网络产生非理想的局部纹理。

为了增强局部纹理,一些工作利用逐块判别器确定逐块分布,并根据不同大小块的接受域调整块大小。此外,逐像素判别器以逐像素的方式区分真假分布,但计算成本较高。然而,上述工作忽略了一个事实:一幅图像的纹理应该符合其语义的分布。实现 SR 的细粒度语义纹理生成是必要的。

为了生成语义感知的纹理,一种直观的方法是将图像的语义信息集成到纹理生成器中,使生成器具有语义自适应能力。实际上,这给语义感知的纹理生成带来了两个明显的缺陷:

  1. 低质量的图像可能导致语义提取的质量变差,甚至错误,从而阻碍了合理的纹理生成。

  2. 在推理阶段,复杂语义抽取器会导致SR网络的计算量和模型复杂度的灾难性增长。相比之下,我们的目标是从另一个角度实现语义感知的SR纹理生成,即,鉴别器。

本文提出了第一个用于 SR 的语义感知鉴别器,称为SeD。值得注意的是,鉴别器通过区分图像/补丁/像素是真实的的还是假的来工作。通过对抗训练,能够测量生成的图像与其参考图像之间的分布距离。如图1所示,vanilla 鉴别器测量了分布距离却忽略了语义,这容易受到粗粒度平均纹理(如噪声)的影响。为了缓解这一问题,我们引入了最近流行的预训练视觉模型(PVM)(如 ResNet 50或CLIP)中提取的语义作为鉴别器的条件,这使得鉴别器能够针对不同的语义单独地和自适应地测量分布距离。在语义感知鉴别器的约束下,SR网络的生成器能够实现更细粒度语义感知纹理生成。

实现SeD有一个关键步骤,即:如何提取语义并将其合并到一个XML中。一种简单的策略是直接从预训练的分类网络中引入最后一层的特征作为语义,并在鉴别器中将它们连接起来作为条件。然而,该方法没有考虑SR的特点,不利于对鉴别器进行有效的语义指导。为了实现细粒度的语义感知纹理生成,一种直觉是,由于不同区域的语义可能不同,因此语义需要是逐像素的。考虑到这一点,我们从PVM的中间特征中提取语义。

除此之外,我们还设计了一个语义感知融合块(SeFB)来更好地将语义融入到鉴别器中。在 SeFB中,我们将从PVM 中提取的语义作为查询,通过交叉注意力将语义感知的图像特征扭曲到鉴别器中,从而实现了更好的语义引导。我们在两个典型的SR任务上验证了我们所提出的SeD的有效性:经典和真实世界图像SR任务。我们的SeD是通用的,适用于基于GAN的SR的不同基准,例如,ESRGAN、RealESRGAN 和 BSRGAN 。

问题:原有的分布学习粗粒度,容易受到虚拟纹理的影响,并导致违反直觉的生成结果。但是,一幅图像的纹理应该符合其语义的分布。实现 SR 的细粒度语义纹理生成是必要的。

本文主要工作:

  • 指出了细粒度语义纹理生成技术在SR任务中的重要性,并首次提出了一种面向SR任务的语义识别器(Semantic-aware Discriminator,SeD),将预训练视觉模型(Pretrained Vision Model,PVM)的语义引入到识别器中
  • 为了更好地融合语义对鉴别器的指导作用,提出了基于语义感知的SeD融合块(Semantic-aware fusion block,SeFB),该融合块提取像素级语义,并通过交叉注意的方式将语义感知的图像特征引入鉴别器
  • 在两个典型的SR任务上进行了广泛的实验,即:经典的和真实世界的图像SR已经揭示了我们所提出的SeD的有效性.此外,我们的SeD可以以即插即用的方式轻松地集成到基于GAN的SR方法的许多基准测试中。

简而言之: SeD + PVM + SeFB

二、相关工作

SRCNN 将CNN引入到 SISR 中,并通过最小化超分辨率图像(SR)与其对应的高分辨率图像(HR)之间的均方误差(MSE)来优化网络。随后,许多工作从不同的角度进一步提高了网络的表示能力,如引入剩余连接、稠密连接、多尺度表示等。具体地,一些工作采用注意机制来进一步增强高频纹理。然而,这些方法缺乏对图像中存在的长相关性的利用,从而限制了它们在SR上的性能。随着 ViT 的出现,一些研究[37,42,69]将像素视为token,并利用基于窗口的自我注意的长程依赖性,适用于经典与真实世界SR任务。

为了生成更吸引人的图像,一些工作旨在利用生成模型的出色能力来增强SR网络的主观质量。引入对抗性损失,使SR网络能够学习真实世界高质量图像的分布。SRGAN 作为基于GAN的SR的第一项工作,系统研究了GAN对SR的优势。在此之后,一系列工作开始细化SR网络的架构(即,生成器),实现稳定的训练和更真实的纹理。尽管如此,很少有工作考虑优化GAN中的另一个核心组件:该算法用于确定SR网络学习到的分布是否与真实世界的高质量图像一致?由此,提出的语义感知鉴别器(SeD)有望使SR网络实现更细粒度的语义感知纹理生成。

受益于大规模数据集,如ImageNet 22 K [11],JFT-300 M [60],LAION-5 B [58]和精心设计的预训练策略[12,21],预训练视觉模型(PVM),例如,ViT [7,14],Swin Transformer [40,41]已经证明了它们在各个领域的巨大潜力,例如,分类,视觉语言任务,生成任务。与较小的模型相比,PVM对大多数下游任务都很友好,这要归功于它们强大而鲁棒的表示能力。最近,大型视觉语言模型 CLIP 由于利用大量收集的视觉语言对来学习更细粒度的语义空间而引起了极大的兴趣。因此,一系列工作将 CLIP 的这个强大的特征提取器纳入各种任务中,包括提示学习,生成等。受此启发,我们的目标是从 CLIP 中提取更细粒度的语义来指导我们的 SeD。

三、方法

首先回顾典型的基于 GAN 的 SR 方法,然后描述该方法与它在整体框架中的差异。接下来将详细阐述我们提出的语义感知鉴别器。最后,我们描述如何将我们的 SeD 集成到现有的逐块鉴别器和逐像素鉴别器中。

SeD框架

我们提出的语义感知鉴别器(SeD)的整体框架如图2所示。给定低分辨率图像$Ii$,我们可以首先获得超分辨率图像$Is$。然后,使用判别器 D来区分$Is$和高分辨率图像$I_h$,这强制SR网络生成类真实图像(即$P(I_s) = P(I_h)$)。然而,普通的分类器只考虑了图像的粗粒度分布,而忽略了图像的语义。这将导致SR网络产生虚假甚至更差的纹理。一个有前途的纹理生成应该满足其语义信息。因此,我们的目标是实现语义感知的语义,它利用高分辨率图像$I_h$的语义作为条件。在这里,我们将大型视觉模型中的语义提取器表示为 $ϕ$,我们的目标是实现更细粒度的语义感知纹理生成。

原始GAN、SeD、SeFB、Patch-wise SeD

如图所示,高分辨率图像$I_h$将被送到来自型视觉模型的固定的预训练语义提取器中以获得语义$ϕ(I_h)$,然后使用语义感知融合块SeFB,通过将语义视为查询,将超分辨率图像特征$f^s$和高分辨率图像特征$f^h$进一步变形为超分辨率图像特征$f^s_s$,$f^h_s$。基于语义感知的特征,该算法可以实现语义感知的分布度量。值得注意的是,这个过程不会增加SR网络在推理阶段的参数或计算成本,因为不需要递归。

SeD具体结构

我们的语义感知鉴别器由两个基本组件组成,即语义特征抽取器和语义感知融合块。通过将这些成分结合到流行的鉴别器中,我们可以得到语义感知的鉴别器。

3.3.1语义挖掘

成功的语义挖掘在语义识别中起着不可替代的作用。直觉是,更细粒度的语义将促进鉴别器测量更细粒度的分布。因此,最近流行的预训练视觉模型(PVM)具有更强的表示能力,适合于语义挖掘。其中,CLIP模型已成为突出的中坚力量,并已在各种任务中得到应用。因此,我们采用预先训练的片段 “RN50” 模型作为语义抽取器,因为我们需要对 SR 进行像素级的语义信息。

具体地说,RN50 由四层组成,随着层的增加和语义的变得更加抽象,特征的分辨率被下采样。为了考察哪一层更适合我们的语义挖掘,我们对这四层进行了系统的实验,实验发现第三层的语义特征是最优的。这里,我们将语义抽取器表示为ϕ,并通过将高分辨率图像$I_h$送入ϕ来提取语义特征f。

3.3.2 语义感知融合

在获得语义$S_h$之后,我们利用我们提出的语义感知融合块(SeFB)来实现判别器的语义引导。考虑到超分辨率/高质量图像$f^s f^h$的特征,我们的目标是将语义感知的纹理从图像扭曲到纹理,从而强制纹理集中于语义感知的纹理的分布。因此,在图2(c)中,语义$S_h$被传递到自注意模块,然后,作为查询被馈送到交叉注意力模块:$Q = LN(SA(LN(GN(S_h))))$,其中LN、GN、SA表示层归一化、组归一化和自注意模块。然后,超分辨率/高质量图像的特征$f^s f^h$被传递到卷积层,并被视为键值 $K^s K^h$和值$Q^s Q^h$。最后,具有交叉注意力的变形语义感知图像特征与原始增强特征级联以形成最终特征$f^s_s f^h_s$,如下:

扩展到其他鉴别器

在本文中,我们将我们提出的SeD结合到两种流行的鉴别器中,包括patch-wise鉴别器和pixel-wise鉴别器。如图2(d)所示,patch-wise鉴别器由三个SeFB和两个卷积层组成。对于pixel-wise鉴别器,我们遵循[66]中的方法,并利用 U-Net 架构作为主干。在浅层特征提取阶段,我们用我们提出的SeFBs代替原始卷积层。

四、实验

4.1 实验设置

网络结构:对于生成器G,我们使用竞争的RRDB 作为主干。

同时还采用了流行的基于Transformer的 SR 网络SwinIR 作为我们的生成器。对于鉴别器,我们将我们的SeD结合到两种类型的鉴别器中,即,patch-wise 鉴别器和 pixel-wise 鉴别器,即 P+SeD和U+SeD。我们还在基于VGG 的图像鉴别器上验证了我们的SeD,称为V+SeD,见附录。

经典图像SR的实现细节:我们使用SeD在两个典型的SR任务上进行了实验,包括经典图像SR [62]和真实世界图像SR [66]。

经典的图像超分辨算法是利用双三次下采样技术实现低分辨率图像的超分辨。在前面的工作之后,我们使用来自DF2K [1,61]的3450个图像来训练我们的网络。我们在五个基准测试集上测试了我们的方法:Set 5 [2]、Set 14 [75]、Urban 100 [22]、Manga 109 [47]和DIV 2K验证集[1]。我们使用MATLAB的双三次下采样核来合成所有的×4的训练样本。我们按照先前的技术[32,37,71],对所有训练样本应用相同的数据扩充。HR图像的patch大小为256 × 256。我们使用 PyTorch 在4个NVIDIA V100 GPU上进行了实验,每个设备上的 batch_size 为8。该方法采用面向 PSNR 的预训练模型对发生器参数进行初始化。我们使用学习率为1e-4的Adam优化器来优化我们的网络。总的训练迭代次数为 300000

真实世界图像SR的实现细节:我们还对真实世界图像SR进行了实验。我们将性能与原始的SR三种最先进的方法:Real-ESRGAN [66],LDL [38]和SwinIR [37]。在此之后,我们评估了几个常用的真实世界低分辨率数据集的性能,包括DPED [23],OST 300 [64]和RealSRSet [77]。

这三种方法的训练策略和数据集略有不同。为了保持公平,我们遵循他们原始的训练设置,用我们的SeD训练生成器,并将视觉质量与他们原始的基于GAN的结果进行比较。此外,我们采用众所周知的非参考度量NIQE [48]进行定量比较,因为 ground-truth 图像在真实的世界中不可用。

4.2 经典图像SR的结果

对SeD和最先进的基于GAN的SR方法进行了定量比较。SFTGAN [64]结合了从输入LR图像中提取的语义映射,以更好地恢复纹理。ESRGAN [65]和USRGAN [76]都使用RRDB [65]作为生成器的主干。LDL [38]使用RRDB将伪影贴图应用到RRDB中,以更好地重建更精细的纹理。

因此,我们用RRDB作为生成器,与它们进行公平的比较。为了验证泛化能力,我们还使用另一种生成器架构来验证我们的SeD,即,基于transformer的SR骨架,SwinIR 。

如表1所示,我们的SeD在感知度量(即,LPIPS),包括SFTGAN [64],ESRGAN [65],USRGAN [76],LDL [38]和DualFormer [44],具有可比的甚至更高的客观质量。值得注意的是,对于表1的最后几行,我们通过将SeD合并到不同的生成器(即,RRDB [65]和SwinIR [37])和鉴别器(分块鉴别,即,“+P”和U形像素级的像素级,即,“+U”)。

“RRDB+P”,可以观察到我们的 SeD(即“RRDB+P+SeD”)在任何情况下都优于 LPIPS 中的原始鉴别器,甚至在 Manga109 数据集中 PSNR 增益高达 1.0dB。

这表明在 SeD中引入语义指导的优越性,因为它可以在训练过程中区分更多的细粒度纹理,从而获得更好的感知质量。注意,我们的SeD在基于Transformer的SR方法SwinIR上也表现良好(即,“SwinIR+P+SeD”和“SwinIR+U+SeD”)。这证明了SeD在不同生成器架构上的泛化能力。

表1,三个内容分别是LPIPS↓/PSNR↑/SSIM↑

我注意到,其他方法恢复的图像纹理不自然。如最后一排将汽车前面的点状纹理误认为条纹等。与其他方法相比,我们的SeD生成了视觉上令人愉快的结果,而不引入伪影。这证明了通过SeD结合语义指导可以使用户能够区分更精细的细节。我们在附录中提供了更多的视觉结果。

4.3 真实世界图像SR的结果

我们通过将其纳入最先进的方法(包括Real-ESRGAN 和LDL )来评估SeD在真实世界图像SR问题上的性能。通常,Real-ESRGAN和LDL都使用RRDB作为生成器,但LDL用 artifact 的 U-Net替代了普通的U-Net。我们还使用更强大的基于Transformer的发生器SwinIR [37]进行实验,SwinIR的定性结果见附录。所有上述方法都使用像素级U-Net算法,因此,我们使用像素级U-Net算法“U+SeD”进行实验。

表2中展示了定量比较。我们的SeD在不同的骨干和训练策略方面超过了大多数真实世界数据集上的普通鉴别器。结果表明,我们的SeD是能够区分严重失真的现实世界的图像,并学习细粒度的纹理生成能力。

表2

4.4 消融研究SeD

我们进行消融实验,以调查最合适的方式引入语义指导到神经网络。我们主要关注三个方面:i)在SeFB中融合语义特征的最佳方式是什么?ii)CLIP的哪一层包含最有用的语义信息用于纹理鉴别?iii)哪种预训练模型更适合作为语义提取器?

不同融合方法的效果:有一系列的融合方法来引入先验信息,包括特征级联,空间注意,或通道注意。比较我们提出的SeFB(即,SeD-Our)与不同融合策略的融合。信道注意力(channel attention即,SeD-B)破坏了语义的空间信息,性能最差。级联操作的性能(concatenation operation 即,SeD-A)和空间注意力(spatial attention即,SeD-C)是可比的,这是明显低于我们提出的语义感知融合块(SeFB)。更多细节可以在附录中找到,以实现上述融合策略。

不同层的语义:值得注意的是,CLIP 不同层的语义是不同的。随着层数的增加,语义的代表性会更强,但分辨率会降低。有效的语义引导的本质在于提取足够深的语义特征,同时保留必要的空间信息,以确保恢复引导的质量。CLIP语义提取器内部共有四层,每层后空间分辨率减半。为了研究哪一层是指导的最佳选择,我们进行了表4中的实验。

从表中可以看出,在第一层和第二层中,语义特征具有相对较大的空间分辨率,但其缺乏集中性可能导致用于区分过程的次优语义指导。最后一层空间分辨率太小,可能会导致忽略像素一致性。结果表明,第三层语义的性能最好,这是我们在本文中使用的。

不同语义提取器的效果:为了更深入地研究更细粒度的语义理解是否能提高指导质量的问题,我们比较了两种不同的语义提取器。具体而言,我们使用ImageNet数据集对比来自预训练CLIP的“RN 50”模型对预训练ResNet-50 [20]进行了评估,该模型使用视觉语言数据集,详见表5。实验结果表明,用视觉语言数据预训练的“RN 50”模型比前者具有更好的识别效果。CLIP训练方案中的语言描述提供了比传统分类任务中使用的数字标签更全面、更详细的语义上下文,这是其上级性能的主要原因。这一发现强调了语言增强模型在实现对语义的更精细理解方面的潜力,从而为区分过程提供了更有效的指导。

4.5.地形特征的T-SNE可视化

为了验证该语义指导是否促进了SeD执行更细粒度的区分,我们使用T-SNE可视化了普通SeD和SeD的中间特征[63]。我们从ImageNet中随机选择了7个类别,每个类别100张图像。然后,我们将所有图像输入到普通PatchGAN和我们的P+SeD中。我们分别可视化SeD的第一个SeFB之后的特征和PatchGAN的第一个BN层之后的特征。如图5所示,SeD的特征是良好聚类的,而普通Patch判别器的特征是混乱的。这提供了证据,证明在语义的指导下,SeD能够执行更细粒度的区分,正如论文中所声称的那样。wu

结论

提出了一种简单的、有效的图像超分辨率语义识别器(SeD)。我们发现,以往的判别器的分布学习过于粗粒化,导致了虚拟纹理或违反直觉的纹理。为了缓解这一问题,我们引入了预训练视觉模型(PVM)的图像语义作为鉴别器的条件,并提出了语义感知融合块(SeFB),以鼓励SR网络学习细粒度的语义感知纹理。此外,SeD算法易于与大多数基于GAN的SR算法相结合,并取得了良好的性能。在经典SR和真实SR上的大量实验证明了该方法的有效性.

CoSeR

CVPR 2024

CVPR 2024 超分辨率大模型!华为和清华提出CoSeR:基于认知的万物超分大模型-CSDN博客

一、介绍

现有的图像超分模型问题如下:

  • 缺乏泛化能力。为了实现更好的超分效果,通常需要针对特定场景使用特定传感器采集到的数据来进行模型训练,这种学习方式拟合了某种低清图像和高清图像间的映射,但在其他场景下表现不佳。此外,逐场景训练的方式计算成本较高,不利于模型的部署和更新。
  • 缺乏理解能力。现有的超分方法主要依赖于从大量数据中学习图像的退化分布,忽视了对图像内容的理解,无法利用常识来准确恢复物体的结构和纹理。

该论文认为,真正能有效应用于真实场景的画质大模型应该具备类似系统二的多步修复能力,即基于对图像内容的认知,结合先验知识来实现图像超分(Cognitive Super-Resolution,CoSeR)

CoSeR 模仿了人类修复低质量图像自上而下的思维方式,首先会建立对图像内容的全面认知,包括识别场景和主要物体的特征,随后将重点转移到对图像细节的检查和还原。本文的主要贡献如下:

  • 提出了一种通用的万物超分画质大模型CoSeR,它能够从低清图像中提取认知特征,包括场景内容理解和纹理细节信息,从而提高模型的泛化能力和理解能力
  • 提出了一种基于认知特征的参考图像生成方法,它能够生成与低清图像内容一致的高质量参考图像,用于指导图像的恢复过程,增强图像的保真度和美感度。
  • 提出了一种“All-in-Attention”模块,它能够将低清图像、认知特征、参考图像三个条件注入到模型当中,实现多源信息的融合和增强
  • 在多个测试集和评价指标上,相较于现有方法,CoSeR均取得了更好的效果。同时,CoSeR在真实场景下也展现颇佳。

三、结构介绍

CoSeR整体结构

CoSeR 首先使用认知编码器来对低清图像进行解析,将提取到的认知特征传递给Stable Diffusion模型,用以激活扩散模型中的图像先验,从而恢复更精细的细节。此外,CoSeR 利用认知特征来生成与低清图像内容一致的高质量参考图像。这些参考图像作为辅助信息,有助于提升超分辨率效果。最终,CoSeR使用提出的“All-in-Attention”模块,将低清图像、认知特征、参考图像三个条件注入到模型当中,进一步提升结果的保真度。

与直接从低清图像中获取描述的方法相比,CoSeR 的认知特征保留了细粒度的图像特征,在生成具有高度相似内容的参考图像时具有优势。在图5的第一行,使用BLIP2从低清图像生成的描述无法准确识别动物的类别、颜色和纹理。

Transformer with ATD

CVPR 2024

(有点晦涩,不太好理解……)

摘要:

Transformer目前基于窗口的自注意力机制接受区有限。为了解决这些问题,我们在 SR Transformer 中引入了一组辅助的自适应令牌词典(Adaptive Token Dictionary),并建立了一种 ATDSR 方法。引入的令牌字典(Token Dictionary)可以从训练数据中学习先验信息,并通过自适应细化步骤将学习到的先验信息适应于特定的测试图像。该求精策略不仅可以为所有输入标记提供全局信息,而且可以对图像标记进行分类。在类别划分的基础上,我们进一步提出了一种基于类别的自注意机制,旨在利用距离较远但相似的标记来增强输入特征。

一、介绍

问题:SR Transformer能够集成多种信息,但在高 SR 精度和增加的计算复杂度之间难以取得平衡。

已有的基于窗口的方法会约束感受野并影响性能。而扩大窗口会缓解问题却又加剧了维度灾难

需要有效的方法来有效地实现长距离依赖建模,而不受本地窗口的约束

解决方法:引入“Token Dictionary”,增强图像处理中的交叉注意和自注意计算。优点如下:

  1. 使用交叉注意力将外部先验信息整合到图像分析中。
  2. 使用全局信息来建立远程连接。这是通过使用激活的标记来细化字典来实现全局信息的使用,以建立远程连接。这是通过使用激活的标记来细化字典来实现的,以通过注意力的反向形式来全局地总结特定于图像的信息。
  3. 允许使用图像的所有相似部分来增强图像token,不受局部窗口分区的限制。

亮点:

  • 引入 Token Dictionary,利用一组辅助Token提供先验信息的每个图像Token和总结的先验信息

  • 利用Token Dictionary 将图像 Token 分组到类别中,并突破局部窗口的边界,以基于类别的自注意方式利用长程先验。

  • 结合所提出的 Token Dictionary 的交叉注意和基于类别的自注意,有效地利用长程依赖。

  • 这几种方法的结合无缝集成了局部、全局和外部信息

二、相关工作

CNN:SRCNN、VDSR、EDSR、RDN、CSNLN、NLSA

ViT:IPT、SwinIR、CAT 表明基于Transformer的方法在图像SR领域的适应性和影响力越来越大

提出了两种类型的注意力:令牌字典交叉注意力(ATD-CA)以利用外部先验、自适应基于类别的多头自注意力(AC-MSA)来建模长距离依赖关系。与基于窗口的注意力协同时,该方法集成了局部、全局和外部信息。

三、方法

动机:讨论了基于字典学习的超分辨率方法如何利用学习到的字典为图像超分辨率提供补充信息,然后分析了注意操作,并讨论了它与基于字典学习的超分辨率方法中的系数计算和信号重构过程的相似性。我们讨论了这两种方法如何激励我们引入一个辅助标记字典,以增强图像处理中的交叉和自注意计算。

在深度学习时代到来之前,字典学习在为图像SR提供先验信息方面发挥着重要作用。

传统方法将图像划分为小块来建模图像局部先验。将$x ∈ R^d$表示为低分辨率(LR)图像中的矢量化图像块。为了估计相应的高分辨率(HR)patch $y ∈ R^d$,学者通过解决稀疏表示问题来分解信号:

image-20241203161052414

$D_L ∈ R^{d×M}$和$D_H ∈ R^{d×M}$是学习的LR和HR字典,M是字典中的 atoms 数目。

Transformer中的核心是自注意力操作,利用 Token 之间的相似性作为权重来相互增强图像特征。问题是复杂程度会随着 token数目呈二次方级增长。已经提出移位窗口(shift-window),锚注意力(anchor attention)和移位交叉注意力(shifted crossed attention)等不同策略。

高级交叉、自注意力与令牌字典:

字典学习的思想可以很容易地融入到 Transformer 框架中,以打破局部窗口的限制。具体地,可以在令牌字典学习方式中采用耦合字典学习的类似思想。

TDCA 介绍了如何建立一个特征字典,从训练数据集中学习典型结构,并利用交叉注意操作将学习到的补充信息提供给所有的图像特征

此外,通过使用激活的标记细化字典,我们可以将学习的外部字典调整为图像特定的字典,以更好地适应图像内容,并将汇总的全局信息传播到所有图像标记。

特征字典的另一个优点在于其与图像特征的相似性矩阵。根据最接近的字典项目的索引,我们能够将图像令牌分组到类别中。本文提出了一种基于类别的自注意模型,该模型不需要利用同一局部窗口中的图像标记来增强图像特征,而是采用了基于类别的自注意模型(3.4)使我们能够从整个图像中的类似标记中获益。

ATD-CA

TDCA示意图

核心:引入一个额外的字典$D∈R^{M×d}$,初始化为网络参数,以在训练阶段总结外部先验。

使用学习到的标记字典D来生成Key字典$K_D$和Value字典$V_D$,并使用输入特征$X ∈ R^{N×d}$来生成Query标记:

类似于Self-Attention中的计算公式

其中$W^Q ∈ R^{d×d/r}$、$W^K ∈ R^{d×d/r}$和$W^V ∈ R^{d×d}$分别是查询标记、键字典标记和值字典标记的线性变换。我

将查询标记和关键字典标记的特征维数降为1/r,以减小模型规模和复杂度。

用 Key Dictionary和 Value Dictionary 通过交叉注意力计算来增强查询标记:

image-20241203182905764

A 是注意力图。

TDCA 先在关键字字典中选择相似的标记,获得注意力图,这类似于等式(1)中的稀疏表示过程。然后TDCA利用相似度值对值字典中对应的标记进行组合,相当于用HR字典原子和表示系数重构HR补丁。

作用:将外部先验信息嵌入到学习的字典中,以增强输入图像的特征

自适应字典细化

多层感知器 MLP 将每层中的图像特征投影到不同的特征空间,因此需要为每层学习不同的令牌字典。

问题:大量的附加参数。

解决方法:一种自适应细化策略,基于相似性图和相反的注意力形式更新的特征,来细化前一层的令牌字典。

为输入特征和令牌字典设置层索引 l ,$X^l$和$D^l$分别表示第l层的输入特征和令牌字典。

只为初始层$D^1$建立一个令牌字典作为网络参数,整合外部先验知识。下面的层中,每个字典$D^l$都是基于前一层的$D^{l−1}$来细化的。对于字典 $d^l_i$ 中的每个记号,i=1,…,M,在增强特征$X^{l+1}$中选择对应的相似令牌。

更具体地,将$a^l_i$表示为注意力映射$A^l$的第$i$列,包含$d^l_i$与所有N个查询令牌$X^l$之间的注意力权重。因此,基于每个$a^l_i$,选择相应的增强令牌$X^{l+1}$来重构新的令牌字典元素$d^l_i$,并将它们组合形成$D^l$。

image-20241203171052134

Norm 是归一化层。这种细化也可以被视为注意力的一种反向形式。(4) 将更新后的特征信息汇总到令牌字典中。

然后,基于参数σ,自适应地组合$xD^l$和$D^l$获得$D^{l+1}$。

以这种方式,细化的令牌字典能够整合输入图像的外部先验和特定内部先验

我们不需要将图像划分为窗口,并且X(1)表示所有图像标记。从初始令牌字典D(1)开始,它将外部先验引入网络,我们的自适应细化策略逐渐从整个图像中选择相关令牌来细化字典。字典的简化可以跨越自注意力窗口的边界,总结整个图像的典型局部结构,从而利用全局信息改善图像特征

类信息被隐式地嵌入在细化的令牌字典中。注意力图A包含特征和标记字典之间的相似关系,像素$x_j$和标记字典原子$d_i$之间的相似性越高,表示$x_j$属于$d_i$类的概率越高。这在某种程度上类似于图像分类任务。

基于类别的自适应注意力

基于窗口的注意力计算(以 SwinIR 为代表):严重限制了感受野的范围。且与内容无关的划分策略可能导致不相关的标记被分组到同一窗口中。

为更好地利用自注意力,自适应特征分割可能是一个合适的选择。

TDCA获得的输入特征和令牌字典之间的注意力映射中隐式地包含了每个像素的类信息,我们可以对输入特征进行分类。根据字典令牌相似度图A,将每个像素分类不同的类别分类:$θ_1,θ_2,· · ·,θ_M$:

image-20241203185145341

如果像素 $A_{ji}$在 $A_{j1},A_{j2},…A_{jM}$中最高,这表明像素 $x_j$更可能与字典中的第 i 个令牌 $d_i$属于同一类别,则将像素 $x_j$ 归为 $\theta^i $ 类。

每个类别都可以被看作是一个不规则形状的窗口,其中包含了相同类别的令牌。

但每个类别的令牌数量可能不同,这导致并行效率低和计算负担显著。为解决不平衡分类问题,作者将 θ 进一步划分为子类 ϕ :
image-20241203190520554

其中,类别 $\theta^i$ 包含了 $n_i$ 个令牌。将每个类别扁平化并串联成 Φ,再划分子类别 $[\phi^1,\phi^2,…\phi^j,…$]。划分后,所有子类具有相同的固定大小 $n_s$ 。如下图

image-20241203191524870

左1是输入图像。右4张的白色部分表示单个关注类别

AC-MSA 可以被表示如下:

image-20241203191551896

其中 Categorize运算为式 6 和式 7 的组合。将每个子类别视为一个注意力组,并在每个组内执行多头自注意力。

最后用 UnCategorizeUnCategorize 反分类操作将每个像素返回他原来的位置。

子类别划分限制了每个注意力组的大小,只对感受野有轻微影响,这是因为式 7 中划分子集时的排序操作产生了随机打乱的效果,因此每个子类别都可以看作该类别的随机样本,某个子类别的令牌仍然可以遍布整个特征图,保持全局感受野。

组合在一起

有了我们提出的 ATD-CA ,自适应字典细化 ADR 和 自适应基于类别的多头自注意 AC-MSA ,我们能够建立我们的自适应令牌字典 ATD 网络用于图像超分辨率。

给定一个输入的低分辨率图像,首先使用3×3卷积层来提取浅层特征。然后将浅特征馈送到一系列 ATD 块中。

每个 ATD 块包含若干 ATD Transformer 层。我们将令牌字典交叉注意ATD-CA、基于自适应类别的多头自注意AC-MSA 和常用的基于移位窗口的多头自注意 Windows-Attention 组合起来,以形成Transformer层。三个注意力模块并行工作,以利用输入特征的外部、全局和局部特征。然后,通过求和运算来组合特征。

除了attention模块之外,我们的Transformer层还使用了LayerNorm和FFN层,这两个层在其他基于transformer的架构中经常使用。令牌字典从每个ATD块中的可学习参数开始参与了每一层Transformer的令牌字典交叉关注,并利用自适应字典细化策略来适应下一层的输入特征。

ATD块之后,利用一个额外的卷积层进行 pixel-shuffle 生成最终的HR估计。

实验

六个ATD块,每个ATD块包括 channel_number 为210的六个Transformer层。

每个ATD块为我们的外部标记字典$D^1$建立128个标记,使用缩减率r = 10.5将通道数减少到20用于相似性计算。

image-20241209110443190

CFAT

CVPR 2024 三角形注意力窗口

摘要

基于 Transformer 的模型通过利用其固有的捕捉复杂上下文特征的能力,彻底改变了图像超分辨率(SR)领域。

目前,在Transformer结构中使用的重叠矩形移位窗口技术(HAT + SwinIR)是超分辨率模型中的一种常见做法,以提高图像放大的质量和鲁棒性。

问题:基于Transformer的结构与模型容易在边界处遭受失真并且具有有限的独特移位模式。

为克服这些缺点,我们提出了一种非重叠三角形窗口技术,与矩形窗口同步工作,减轻边界层畸变,并允许模型访问更多独特的筛选模式。

提出了一种基于三角-矩形窗的局部注意+基于通道+全局注意相结合的复合融合注意Transformer(Composite Fusion Attention Transformer,CFAT)。CFAT能够在更多的图像像素上激活注意机制,并捕获长距离、多尺度特征提高SR性能。

大量实验结果和消融研究证明了CFAT在SR域的有效性。我们提出的模型显示,与其他最先进的SR架构相比,性能显著提高了0.7 dB。

一、介绍

“尽管进行了广泛和一致的研究,SR模型仍然难以完全消除恢复图像中的视觉伪影。”

2014年初,深度神经网络的发展增强了SR能力,CNN作为主架[10]。这些方法[9,19,44,45]经常伴随着大量的计算和存储需求,而不管它们的有效性如何。

基于Transformer的技术在众多新兴模型中脱颖而出,成为最成功的SR方法,展示了近年来最先进的性能。它们天生就擅长利用图像特性之间的长期依赖关系。SwinIR[25]、Swin 2SR [8]、ESRT[28]、HST[21]、HAT[6]和ART[43]等领先方法都主张上述益处。它们主要依赖于分层注意机制,确保从LR对应项重建HR输出的精度得到提高。SwinIR [27]率先将移位窗口技术应用于图像恢复[25]领域,主要关注图像超分辨率。Swin2SR 重新定义了SwinIR,以在有效解决数据和培训相关挑战后提高性能。

问题:密集和稀疏注意力层之间的快速内部切换(每个层针对特定的感受野定制)对整体性能造成了限制。

HAT :将全局通道注意力与基于局部窗口的自注意力相结合,优于其他突出的超分辨率架构。

重叠移位窗口技术的引入有效地解决了与重复图像块相关的问题,而通道注意力的引入大大增强了超分辨率性能。ACT :将CNN和Transformer定位在两个不同的流中,以同时利用全局和局部特征。两个分支上的和谐互补特征通过基于跨尺度令牌注意力(CSTA)的通道分裂融合块彼此交换相关信息。

问题:现有技术的基于Transformer的方法使用基于矩形移位窗口的自注意机制,但是

1. 由于边界像素的的参与有限,每一层重复使用矩形窗口注意力很容易导致边界级失真。

2. 矩形窗口的对称结构限制了覆盖整个图像块的独特移位模式的范围。

边界级失真的存在和移动矩形窗口技术中有限范围的移动模式(即上述两点)会阻碍其有效性,从而超越超分辨率扩展到其他计算机视觉任务。

解决方案:提出了一种开创性的三角窗技术。有助于提高超分辨率任务和所有主要使用矩形窗口技术的计算机视觉应用的性能。本文将三角形窗口与传统的矩形窗口中的一个Transformer框架称为 Composite Fusion Attention Transformer(CFAT)。将基于通道的全局注意力单元与上述基于三角-矩形窗口的局部自注意力相结合,提高单图像SR的性能。

注:上述注意力对属于非重叠注意力类别,并且有效地利用了局部和全局图像特征。

每个单元块的末尾放置了一个重叠的交叉融合注意块(OCFAB),称为密集窗口注意块(DWAB),以充分利用图像的重叠特征。

CFAT具有以下几个独特的优点:

i)基于窗口的自注意技术消除了传统基于矩形窗口的自注意过程中出现的边界水平失真问题

ii)三角形窗口提供了更广泛的移位模式,从而扩展了空间特征并增强了整体性能。

iii) OCFAB利用重叠的空间图像特征,从而进一步增强性能

提出的 CFAT网络在多个基准数据集上提供了好的 SR结果,明显优于最近的基于Transformer的SR技术。本文的主要贡献可以概括为:

  1. 在计算机视觉任务中引入了三角窗机制。该方法克服了传统矩形窗方法的边界失真和唯一移动模式等限制,提高了图像的信噪比。
  2. 这种窗口机制不仅在超分辨率任务中是有益的,而且在其他矩形窗口技术的计算机视觉应用中也有益的。
  3. 提出一种CFAT,分别通过重叠和非重叠的空间和信道注意利用局部和全局图像特征。
  4. 基于多个基准SR数据集的综合评价表明,该方法的性能高于其它。

三、方法

CFAT总体结构

shallow Feature extraction:简单的 3×3 卷积来提取特征 $F_{sh}$

中间部分

密集窗口注意块(DWAB)和稀疏窗口注意块(SWAB)与卷积层组合,形成深度提取器模块。

DWAB 的每部分实现了非重叠和重叠的密集窗口注意力,结合了多个非重叠的注意单元,称为密集混合窗口注意块(D-HWAB),最初获得深层特征,

在最后放置一个重叠的注意单元,称为重叠交叉融合注意块(OCFAB)获得不同的特征。

最后的3 × 3卷积层可以使特征更丰富,更有效。

image-20241206180304564

其中$f^n_{nop}、f_{op}、f_{conv}$分别代表非重叠、重叠和卷积操作。

密集混合窗口注意力模块 D-HWAB:底层模块交替结合了组合移位矩形和新颖的三角形Transformer单元。在这两个单元中执行的多头自注意(MSA)被称为移位密集矩形窗口MSA((SD) RW-MSA)和移位密集三角形窗口MSA((SD) TW-MSA),都执行非重叠的自我注意。

在两个Transformer单元中,来自通道智能注意力块(CWAB)的通道注意力特征与来自(SD)RW-MSA和(SD)TW-MSA的空间注意力特征的组合提高了整体性能。

image-20241206180953896

其中,$F_{DA}$、$f^x_{rect}$和$f^x_{tri}$分别是密集注意力特征、矩形和三角形窗口密集注意力。

矩形Transformer单元的输出特征表示为

image-20241209102106841

其中,$F_{in}、F_{int}、F_{out}$分别是输入、中间和输出要素。$f^{rect}{MSA}、f^1{LN}、f^2_{LN}和f_{CA}$分别是(SD)RW-MSA、First LayerNorm、Second LayerNorm和CWAB中的特征变换。

类似地,三角transformer单元的输出特征可以表示为:,和上面矩形的非常类似。

image-20241209102433824

其中,$f^{tri}MSA$是 (SD)TWMSA的特征变换。等式4中的α和等式6中的β是两个超参数,分别限制矩形和三角形Transformer单元的$F{out}$中的信道注意力的主导性。

重叠交叉融合注意块(OCFAB)

Overlaping Cross Fusion Attention Block (OCFAB),该块将相邻窗口之间的特征重叠,在它们之间建立交叉注意,进一步提高性能。这种潜在的注意被称为重叠交叉融合注意(OCFA)。OCFAB 通过称为展开操作的滑动窗口方法来实现,使用大小为$R_0$的核、R的跨距和kR 2个零的填充以使大小兼容于重叠。将H×W×C维的输入特征划分为大小为$R_0$的$\frac{HW}{R^2}$个重叠窗口。这里,$R_0$由:$R_0=(1+K)R$ 确定。k 是调节重叠比率的常数,R表示重叠之前的窗口的大小。在MSA期间,查询由线性图层计算,而键和值则由线性图层生成,然后执行展开操作。

Channe-Wise Attention Block(CWAB)

大多数研究表明,在执行 squeeze-excitation channel attention 时,使用标准卷积的做法。

这里使用逐深度逐点卷积,有助于在不增加计算负担的情况下降低 squeeze 因子。

设计了一个具有GELU激活功能的 CWAB,该激活功能夹在两个深度方向的逐点卷积层之间,并在最后跟随一个通道方向的注意模块。

稀疏窗口注意块 SWAB

与DWAB类似,SWAB在稀疏窗口而不是密集窗口上促进非重叠和重叠窗口注意。该模块还包括如图2所示的四个操作:(i)非重叠矩形稀疏窗口注意力(ii)非重叠三角形稀疏窗口注意力(iii)重叠交叉融合注意力(iv)卷积操作。后两者与第3.3.1节中讨论的相同,但前两者在矩形和三角形窗口形成方面与DWAB略有不同。

首先从维度 H×W×C 的输入中准备稀疏窗口,通过在连续的输入特征之间保持一个规则的间隙(称为间隔大小 I)准备稀疏窗口。

在此基础上,按照标准的矩形和三角形窗口技术实现了各自注意力机制。

第4节提供了关于三角稀疏注意力的更多细节。在实现矩形稀疏注意时,我们遵循类似的过程。

长尾问题

最后阶段,通过深度特征($F_{dp}$)通过夹在一对卷积层之间的像素 pixel-shuffle 层来获得放大的输入信号($I_{SR}$)。这由$I_{SR} = f_T(F_{dp})$表示。

四、三角形窗口设计

考虑尺寸为H ×W × C的输入图像$I_{in}$ ,首先将该输入划分为HW上三角窗$M^2$个尺寸为M×M的矩形窗。然后每个矩形 patch 再次被分割成四个三角形窗口。

图中M取为32,提供了四个线性维数为16 * 16的三角形掩码。这四个三角形窗口分别称为上、右、下和左三角形窗口。相应的矩形窗口也显示在该图中。

相对于矩形窗口的优点:计算机视觉中,像素的属性取决于其自身及其相邻像素。在自注意期间,矩形窗口的边缘像素没有像内部像素那样被有效地探测,从而导致边界处的明显失真,会降低模型性能。单独实现时,上述问题在矩形和三角形窗口中都可以明显地看到。

将基于矩形窗口的MSA与我们提出的三角形MSA串联起来。矩形和三角形 Transformer 的这种替代配置减轻了彼此的edge-level distortion。

许多研究证实,移位矩形窗口与非移位版本相结合,可极大增强SR性能。然而,我们可以观察到,由于其等距几何形状,重复发生时在移动矩形窗口时存在限制。从图中可以看出,三角形窗口的覆盖长度在x维度上大于矩形窗口。由于这种扩展的覆盖,三角形窗口比矩形窗口允许更多的不相同移位

image-20241209093937826

矩形窗口具有不相同的0和8的移位模式,而三角形窗口具有0、8、16和24。三角形窗口中更多独特的移位模式的可用性通过减轻边界处的边缘相关伪影、对齐,有助于提高定位精度的特征并提供对非中心图像模式的更大适应性,比矩形窗口进一步增强了模型的性能。

由于矩形和三角形窗口之间存在结构异质性,如上图所示,DWAB或SWAB内部参与三角形和矩形自我注意交替连接的空间特征彼此不同。这些来自连续三角形和矩形注意的多样化激活特征利用更多样化的空间特征参与 HR 重建。进一步提高了性能。

计算成本:简而言之,引入三角形窗口可以有效减轻复杂度

推理过程:在 Transformer 中使用的 MSA 的第一步计算输入$x ∈ R^{HW×C}$的查询矩阵$q = xw_q$,关键字$k = xw_k$和值$v = xw_v$,以及对应的三个可训练参数矩阵$wq ∈ R^{C×C_q}$,$w_k ∈ R^{C×C_k}$和$w_v ∈ R^{C×C_v}$。在我们的例子中,我们考虑$C=Cq=Ck=Cv$和H、W远大于C。

为了数学上的方便,我们假设num_heads 等于1。MSA的近似计算复杂度为

image-20241209095222844

这个等式证实了部署 ViT 的高计算成本。目前只能用矩形窗口技术降低复杂度。

然而,我们的三角形窗口技术,不仅减少了计算负担,而且单独工作比矩形产生更好的结果。

本文我们介绍了两种变体的注意力有关的建议三角形窗口:(i)密集三角形注意力和(ii)稀疏三角形注意力。密集三角形注意力的1D标记大小为L2,其中L是矩形窗口标记L × L的三角形窗口等价物。不

稀疏三角形注意的有效序列长度与密集三角形注意相同,但感受野更宽。

引入间隔长度S控制注意机制中三角形窗口中的稀疏度。S可以与卷积运算中的步幅进行比较。稀疏TW-MSA在参数S方面的计算成本是

image-20241209095851177

五、实验

执行几何数据扩充,每个训练样本由其翻转或旋转(90 °、180 °和270 °)等效样本替换。

将增强的输入样本裁剪成64×64个面片。

配置CFAT时,将3个DWAB和3个SWAB以交替顺序放置。每个DWAB和SWAB单元中分别保持4个D-HWAB和4个S-HWAB。这里,每个D-HWAB和SHWAB单元表示唯一的移位大小,即,0、8、16和24的整数。

采用180个信道,对于(SD)RWMSA、(S)TW-MSA和OCFA的所有单元,注意头和窗口大小被设置为6和16。

消融研究中讨论了其他高参数值。batch_size 为32。adam优化器进行训练,β1 = 0.9和β2 = 0.999。权重衰减被设置为零。总迭代次数设置为250 K。初始学习速率被设置为2e-4,在[112.5K,175 K,200 K,225 K]次迭代之后,该速率被减小到一半。

使用 L1损失进行模型训练。采用预先训练好的×2模型,并微调到×4分辨率。

还推出了一种更紧凑的CFAT,即CFAT-S,具有144个通道,在CWAB中具有逐深度逐点卷积。

实验使用基于Python 3.10.11的PyTorch 2.0.1深度学习框架,在Ubuntu 20.04.2机器上进行,该机器具有A100-PCIE-40 GB GPU,支持Nvidia CUDA 10.1.243和CuDNN 8.1.0

image-20241209105541232

Adapt or Perish: Adaptive Sparse Transformer with Attentive Feature Refinement for Image Restoration

重点关注内容:FRFN模块

摘要

问题:传统注意力机制通常会通过考虑所有信息,会涉及来自不相关区域的冗余信息和噪声交互,增加计算成本与负担。

方法:提出了ASSA与FRFN,FRFN 采用了增强和缓解方案,以消除通道中的特征冗余,提高清晰图像的恢复。

一、介绍

标准 Transformer 采用密集的注意力关系来聚合特征,这会无意中引入噪音在不相关的区域中相互作用。

需要设计一种有效机制,来识别图像信息中最有价值的功能,提高特征融合效果。

另一方面,开发了一种简单而有效的常规前馈网络的替代方案,即 FRFN,增强特征表示,以更好地恢复图像。

简而言之,FRFN使用 enhance-and-ease scheme 执行功能转换:

增强了特征图的信息部分,然后使用门机制减少冗余。同时,FRFN 补充了原有模块在通道维度上抑制冗余信息的作用,能够增强有价值的特征,同时抑制信息量较少的特征。

同时,FRFN补充ASSA在抑制冗余信息沿着信道维度,而ASSA减少在空间域中的冗余。由于两个互补组件的合作,AST捕获最具代表性的功能,同时在一定程度上抑制信息量较少的功能。

三、FRFN

特征细化前馈网络:常规 FFN 只会单独处理每个像素位置的信息,这在通过自注意机制改进特征表示方面起着至关重要的作用。因此,设计一个有效的FFN增强功能,提高潜在的高质量的图像恢复是至关重要的。当采用ASSA作为去除空间域中冗余信息的基本组件时,通道中仍然存在冗余。为了克服这一点,我们开发的FRFN执行的功能转换中的增强和易用的范例。具体来说,我们通过引入PConv操作[5]来构建FRFN,以加强特征中的信息元素,并引入门机制来减少冗余信息的处理负担。

image-20250217191912746

其中W1和W2表示线性投影; [,]表示通道切片操作; R(·)和F(·)说明了将序列输入转换为2D特征图的整形和平坦操作,并且反过来,这对于将局部性引入架构中至关重要; PConv(·)和DWConv(·)分别指部分卷积[5]和深度可分离卷积运算;深度可分离卷积表示矩阵乘法。

总的来说,FRFN能够通过从信息流中提取那些代表性特征,同时简化冗余特征来增强特征表示。它还为模型提供了清除通道尺寸沿着无信息特征的机会。

StableSR

也是很经典的一篇文章了。

【论文精读】StableSR_diffusion sr-CSDN博客

利用Diffusion先验,所提出方法 为SR任务微调了一个轻量级的时间感知编码器和一些特征调整层。时间感知编码器纳入了一个时间嵌入层来生成时间感知特征,因为迭代过程中冻结了原始Diffusion模型以保留Diffusion先验,故通过时间感知特征在图像恢复过程中为每个Diffusion步骤提供自适应指导,使Diffusion特征在不同的迭代轮次中自适应调整。时间感知编码器在早期迭代步骤提供更强的指导,在后期提供更弱的指导,以保持SR保真度
为了抑制Diffusion模型的生成随机性以及自编码器编码过程中产生的信息损失,在自编码器解码过程中应用了一个系数可调的可控特征包装模块(CFW),来细化Diffusion模型的输出
为了使模型适应任意分辨率图像,引入一种渐进式聚合采样策略。首先将图像划分为重叠的块,并在每个Diffusion迭代过程都使用高斯核对这些块进行融合。这个过程可以平滑图像块边界,以产生了更连贯的输出

原文链接:https://blog.csdn.net/weixin_44934783/article/details/136422455

SinSR

CVPR 2024

CVPR 2024 | SinSR:单步基于扩散的图像超分辨率 - 知乎

(被毙掉了,不太可行QWQ)

SMFA-Net(创新点1)

ECCV 2024

基于Transformer的图像恢复方法之所以表现出色,是因为Transformer中的自注意力(Self-Attention,SA)机制能够探索图像中的非局部信息。这意味着,它不只是看一个像素点周围的几个像素点,而是会考虑整个图像中的信息,来帮助更好地重建出高分辨率的图像。

但是,这种自注意力机制有个大问题,就是需要计算资源非常多,这使得它在那些电量有限的设备(比如手机、平板电脑等)上很难应用。

另外,自注意力机制本身有点像是一个 “低通滤波器”,更擅长捕捉图像的整体结构和趋势,但不太擅长捕捉图像的局部细节。这就像是你从远处看一幅画,能看到大概的轮廓和颜色,但走近了才能看到画上的纹理和笔触。因此,

如果只用自注意力机制来恢复图像,可能会得到比较平滑但缺乏细节的结果

创新点

提出了一个叫做 “自调制特征聚合(Self-Modulation Feature Aggregation, SMFA)” 的模块。通过两个分支来同时利用图像的局部和非局部特征,以达到更准确的图像重建。

一个分支是 “高效自注意力近似(Efficient Approximation of Self-Attention, EASA)”分支,它用来模拟自注意力机制,捕捉图像中的非局部信息。但是,这个分支比传统的自注意力机制要高效得多,需要的计算资源更少。
另一个分支是“局部细节估计(Local Detail Estimation, LDE)”分支,它专门用来捕捉图像的局部细节,确保重建出来的图像既清晰又有细节。

此外,论文作者还引入了一个基于部分卷积的前馈网络(Partial Convolution-based Feed-forward Network, PCFN)来进一步精炼从SMFA模块中得到的特征。这个网络就像是一个“微调器”,它能够对已经很好的特征进行进一步的优化,让重建出来的图像更加完美。

实验结果显示,新的 SMFANet 系列方法在公共基准数据集上取得了很好的性能,同时计算效率也很高。与一些其他的方法相比,SMFANet 在五个公共测试集上的平均性能提高了0.14dB,而且运行速度快了10倍,模型复杂度只有其他方法的约43%。这意味着,你可以用更少的电量和更短的时间,得到质量更高的图像恢复结果。

发展了一种有效的部分卷积前馈网络(PCFN),进一步细化了SMFA在空间和信道维度上的代表性特征。我们制定建议SMFA模块和PCFN到一个端到端的可训练网络,称为SMFANet,解决SISR。大量的实验表明,所提出的SMFANet实现了计算效率和重建性能之间的良好权衡(见图1)。

主要贡献总结如下:

  • 我们开发了一个有效的SMFA模块提取代表性的功能,其中EASA分支用于探索非本地信息和LDE分支用于捕获本地功能。
  • 我们提出了一个轻量级的PCFN,以进一步细化从空间和通道维度的SMFA衍生的特征。
  • 在公共基准数据集上对所提出的SMFANet算法进行了定量和定性的评估,结果表明,所提出的算法在模型复杂度和重建性能之间取得了良好的折衷.

模块详解

该结构以低分辨率图像为输入,采用3×3卷积层提取浅层特征。然后将提取的浅层特征馈送到特征调制块(FMB)序列以产生深层代表性特征,其中FMB由自调制特征聚集(SMFA)模块和基于部分卷积的前馈网络(PCFN)组成。

在特征调制块之后,由图像重建模块处理代表性特征以重建高质量输出。为了使重建模块尽可能轻量化,使用3×3卷积层将通道维度转换为可调整上采样率的特定大小,并使用PixelShuffle层[35]进行放大。为了便于高频信息的学习,我们在图像重建模块之前插入了全局残差连接。

SMFA

探索非局部信息是图像超分辨率重建的重要内容。基于ViT的SR方法利用各种自注意机制来探索非局部信息并实现令人印象深刻的重建性能。然而,这些 self-attention 变体在计算上是昂贵的,且对局部细节建模的能力有限,因为它们的低通滤波器性质使它们优先捕获低频信息。

为了解决这个问题,我们开发了一个轻量级的自调制特征聚合(SMFA)模块,以协作地建模本地和非本地功能,以实现准确的重建。在SMFA模块中,实现了一个有效的自注意近似(EASA)分支,用于以适度的成本进行非局部信息探索,并使用局部细节估计(LDE)分支来捕获局部信息。

给定输入特征$F_{in}∈R^{H×W×C}$,其中 H ×W表示空间大小,C是通道的数量,我们首先对归一化的$F_{in}$应用1 × 1卷积来扩展通道,然后将通道分为两部分作为EASA和LDE分支的输入:

image-20250218164647036

然后,我们经由EASA和LDE分支并行处理特征X和Y,分别产生非局部特征Xl和局部特征Yd。最后,我们将$X_l$和$Y_d$与元素加法融合在一起,并将它们馈送到1×1卷积中,以形成SMFA模块的代表性输出。该过程可表述为:

image-20250218164913465

自注意力的有效近似:通过下采样操作获得低频分量,并将其馈送到3×3的 dwconv 中,以生成非局部结构信息$X_s ∈ R^{H/8×W/8×C}$.

为了嵌入用于调制非局部表示$X_s$的全局描述,我们引入X的方差作为空间信息的统计发散,并通过1 × 1卷积将其与非局部表示$X_s$合并。

局部细节估计:局部细节对于令人满意的高频重建是重要的。由于EASA优先考虑非局部结构信息探索,我们开发了一个简单的局部细节估计层,同时捕获局部特征。详细地,使用具有3 × 3的核大小的扩展的深度方向卷积来对来自输入特征Y的局部信息$Y_h$进行编码。然后,我们使用两个1 × 1卷积和一个隐藏的GELU激活来生成增强的局部特征$Y_d$。

SCTNet

AAAI 2024

论文阅读笔记:SCTNet: Single-Branch CNN with Transformer Semantic Information for Real-Time Segmentation-CSDN博客

APISR: Anime Production Inspired Real-World Anime Super-Resolution

CVPR 2024

摘要

真实世界的动画超分辨率(SR)在SR社区中得到了越来越多的关注,但现有的方法仍然采用来自真实感领域的技术。该论文分析了动漫生产的工作流程,并重新思考如何应用它的特点,为了现实世界的动漫SR。首先,我们认为,视频网络和数据集是没有必要的动漫SR由于重复使用的手绘帧。相反,我们提出了一个动漫图像收集管道(anime image collection pipeline),选择最少的压缩和最丰富的帧从视频源。在此基础上,我们介绍了面向动画制作的图像(API)数据集。

此外,我们确定了两个动画特定的挑战,扭曲和模糊的手绘线(distorted and faint hand-drawn lines)和不需要的颜色文物(unwanted color artifacts)。我们通过在图像退化模型中引入面向预测的压缩模块和具有增强的手绘线的伪地面实况准备来解决第一个问题。此外,我们还引入了平衡的双感知损失(the balanced twin perceptual loss combining both anime and photorealistic high-level features),结合了动画和真实感的高级功能,以减轻不必要的颜色伪影并提高视觉清晰度。我们通过在公共基准上进行广泛的实验来评估我们的方法,表明我们的方法优于最先进的动漫游戏训练方法。

一、介绍

动漫SR专注于将低质量的低分辨率(LR)动漫视觉艺术图像和视频恢复和增强为高质量的高分辨率(HR)形式。它在娱乐和商业领域已表现出重大的实际影响[46、48、54、56、61]。一个新兴的工作线已经解决了这个问题,通过扩展SR网络来捕获多尺度信息或学习自适应退化模型。

在本文中,我们彻底分析了动漫制作过程,探索如何利用其独特的方面在动漫SR的实际应用。制作工作流程首先从纸上手绘草图开始,然后通过计算机生成图像(CGI)处理进行着色和增强[69]。然后,这些处理过的草图被连接成一个视频。由于绘制过程极其劳动密集型并且人眼对运动不敏感[10,37],因此在形成视频时跨多个连续帧重复使用单个图像是标准做法。这一生产过程促使我们重新思考在动漫领域使用视频网络和视频数据集来训练SR网络是否必要和有效。

为此,我们将探索使用基于图像的方法和数据集作为动漫图像和视频的统一超分辨率和恢复框架。创建图像数据集使我们能够更灵活地专门选择压缩程度最低的视频帧作为我们的潜在数据集池,而不是收集包含时间失真的连续帧来创建视频数据集。

此外,通过形成图像数据集,我们可以选择性地聚焦于信息量最大的帧,因为动画视频通常比照片级真实感视频拥有更少的信息。如果我们从动画图像中随机裁剪一个 Patch,则很有可能它是表示缺少信息的单色区域。针对这些现象,本文提出了一种基于关键帧的动画图像采集流水线,沿着一种基于图像复杂度评估的选择标准 (an anime image collection pipeline that focuses on keyframes in video, along with an image complexity assessment-based selection criteria)。该方法的目的是从视频源中识别和选择压缩程度最低、信息量最大的图像。使用我们的管道,我们提出了面向动画制作的图像(API)数据集用于SR训练。此外,我们还发现了现实世界SR任务的两个新的动画特定挑战。首先,在动漫制作中,手绘线条的清晰度是一个非常强调的细节[6,26,56],如图2a所示,但由于网络传输中的压缩和制作中的物理老化,手绘线条很容易被削弱。线的边缘处的这种劣化对视觉效果施加了相当大的负面影响。为了解决这个问题,我们从修复和增强的角度出发。具体地,我们在图像退化模型中提出了一个面向预测的压缩模块来模拟网络传输中的压缩过程,使得用这种自监督方法训练的模型能够恢复手绘线条失真。此外,我们提出一种地面实况(ground-truth,GT)增强方法,借由合并从过度锐化的GT影像中所撷取的手绘线来增强模糊、老化的手绘线。

其次,我们意识到动漫图像中不需要的颜色伪影问题,这是采用基于GAN的SR网络的结果[17](见图2 B)。这些伪影表现为形状不规则、强度不同的彩色斑点,随机散布在生成的图像中,这会显著破坏视觉感知。我们将此问题归因于感知损失的图像特征是在真实感图像数据集上训练的,这在动漫领域是不一致的。为了缓解这个问题,我们进行了全面的研究,感知损失,并引入平衡的双感知损失(balanced twin perceptual loss),组装感知功能,从真实感域和动画域的平衡层缩放分布。

问题:提出了一个动漫图像收集管道

贡献如下:

  • 提出了一个图像退化模型来处理更难的压缩恢复挑战,特别是手绘线失真在动漫领域,用心加强微弱的手绘线条。

  • 认识到并解决了在基于GAN的SR网络训练中由于感知损失的域不一致而引起的不必要的颜色伪影。

  • 在真实世界的动漫SR数据集上彻底评估了我们的方法,并表明我们的方法比最先进的动漫机器人训练的SR方法性能更好,训练样本复杂度仅为先前工作的13.3%。

  • 我们提出了一种新的动漫数据集策展管道,能够从视频源中收集压缩最少,信息量最大的动漫图像。

二、相关工作

真实世界的超分辨率:经典的SR方法通常采用直接的方法,使用单个双三次下采样操作将高分辨率(HR)实况(GT)图像转换成它们的低分辨率(LR)对应物。经典的图像恢复方法为不同的任务训练不同的权重。相比之下,真实世界SR致力于通过一个模型权重来实现复杂的退化模型,以恢复在真实世界场景中发现的各种退化,例如模糊、噪声和压缩。

一般而言,退化模型设计可大致分为两类:显式模型和隐式模型。显式退化模型采用核函数和数学公式来模拟真实世界的退化过程。另一方面,隐式退化模型专注于训练神经网络以捕捉真实世界退化的分布。然而,隐式模型面临着可解释性和可扩展性的挑战。隐式模型的有效性缺乏明确的理论基础,而将其适应新的领域需要创建定制的数据集和额外的训练复杂性。

动画处理:动画代表了视觉艺术的一种独特形式,其特点往往是夸张的视觉表现。动画的创作者通常从素描线条艺术开始,然后是2D和3D动画技术,其中包括着色、CGI效果和帧内插。值得注意的是,最近在动画领域的研究已经获得了大量的关注,具有动画内容的AI绘画、动画图像的矢量化、动画插值和中间插入、动画草图着色、3D表示和动画领域适应。

AnimeSR(NeurIPS 2022)和 VQD-SR(ICCV 2023)是现实世界动画超分辨率任务领域中的两项最新代表性研究。然而,他们并没有完全解决低级别动画修复的独特挑战。这包括在基于GAN的网络训练中的模糊手绘线和域不一致性。本文对动漫SR领域的几种精雕细琢的方法进行了全面的探索。

三、提出的方法

3.1.面向动画制作的图像SR数据集

在本节中,我们将介绍APISR数据集及其工作流。此工作流利用动漫视频的特性来选择压缩最少和信息量最大的帧。基于I-Frame的图像收集。AnimeSR引入了AVC-Train,这是第一个基于视频的动漫SR数据集,但他们忽略了收集过程中压缩的影响,这导致 VQD-SR 提出了一种后处理技术来增强数据集

相反,我们提出一个一种新的方法,以最小的努力从源级选择压缩最少的帧。

互联网上的所有视频都用视频压缩标准(例如,H.264 和H.265),以在质量和数据大小之间进行权衡。有许多视频压缩标准,每个都有一个复杂的工程系统,但它们共享一个类似的主干设计。这个特性促使我们找到分配给每个帧的压缩质量不同的模式。视频压缩将一些关键帧(称为 I-Frames)指定为单独的压缩单位。从经验上讲,I 帧是场景变化场景的第一帧。这些 I 帧被分配有高数据大小预算。相反,更高的压缩比要求非 I-Frames,即 P-Frames和 B-Frames,在压缩期间以 I-Frames作为参考,这引入了时间失真。如图3a所示,在我们收集的动漫视频中,I帧平均具有比其他非I帧高得多的数据大小,这真正代表了更高的质量。因此,我们使用视频处理工具 ffmpeg 从视频源中提取所有I帧作为初始池

基于图像复杂度的选择:为了进一步从I-Frames池中选择理想化的图像,我们需要一些标准。一种简单的方法是遵循AVCTrain使用图像质量评估(IQA)来排名和选择具有更好分数的帧。然而,IQA排名并不喜欢带有CGI效果的动画图像,而是喜欢信息量很少的简单场景(见图4)。因此,我们认为,图像复杂性评估(ICA)是一个更好的选择,在动漫领域。

ICA 通过对存在的细节的数量和种类进行评分来评估图像中的复杂程度。与IQA相比,ICA 对饱和度、闪电、对比度和运动模糊的变化具有更强的鲁棒性。我们使用的ICA指标是最近兴起的分析网络IC 9600 [16]。在动画领域,采用 ICA 呈现两个主要优点。首先,动漫视频中的许多场景都是典型的单调场景(如图4所示),其中大多数像素在训练中缺乏重要信息。IQA倾向于这些简单的图像,并且与其他图像相比给出了更高的分数,但是ICA使得排除这些场景,这又有助于降低训练样本复杂度。

第二,ICA 更擅长于识别动画制作中有意义的场景,尤其是那些具有CGI效果的场景,如图4右侧的黑暗场景。在这些情况下,IQA方法通常会出现问题。通过收集各种场景,网络训练可以在处理复杂的真实世界动画输入方面变得更加健壮。

图4 单调场景,使用HyperIQA和Rechique进行图像质量评估(IQA),对比使用IC9600 [16]进行图像复杂性评估(ICA)。IQA喜欢简单的场景,并对CGI较强的图像给予较低的分数。但ICA恰恰相反。

API数据集:我们开始手动采集 562个高质量的动画视频。从这些中,我们提取所有 I-Frames 作为初始选择池。利用上述图像复杂度评估方法,我们从每个视频的 I-Frames池中选择得分最高的前10个帧。在丢弃不适当的图像(例如,裸体、暴力、异常和与照片真实感内容混合的动画图像),获得3740个高质量图像作为我们提出的数据集。示例图像如图5所示。此外,如图B所示,我们的API数据集的高图像复杂度评分帧的密度明显上级AVC-Train。更多的分析和数据可以在补充材料中找到。

图5 API超分辨率数据集示例。API包括多功能CGI效果场景(例如,不同的闪电和特殊效果)并呈现高图像复杂度。

720P恢复原始分辨率:在研究动画制作管道时,我们观察到大多数动画制作遵循720P格式(图像高度为720像素)。然而,在现实世界中,为了标准化多媒体格式,动画经常被错误地放大到1080 P或其他格式。我们的经验发现,重新缩放所有动画图像回到原来的720 P可以提供的特征密度所设想的创作者与更紧凑的动画手绘线和CGI信息。

3.2.一种实用的动漫退化模型

在现实世界的SR中,退化模型的设计是非常重要的。基于高阶退化模型和最近的基于图像的视频压缩恢复模型,我们提出了两项改进,以恢复扭曲的手绘线和多功能压缩伪影,并增强退化模型的表示。退化模型如图6a所示。

图6 退化模型,概述我们提出的方法

面向预测的压缩:利用图像退化模型在视频压缩伪影的动画恢复中提出了挑战。这是因为先前的真实世界图像SR方法采用JPEG(一种旧的但广泛使用的图像压缩标准)作为图像退化模型中的唯一压缩模块。JPEG对所有编码单元进行重复且独立的压缩,而不考虑其他单元的存在。然而,为了获得更高的压缩比,视频压缩算法会应用预测算法来搜索具有相似像素内容的参考,并仅压缩它们的差异(残差),从而降低信息熵。预测算法可以在空间(帧内预测)或时间(帧间预测)上搜索其参考。无论属于哪种类别,失真的内在原因都来自于由于预测限制而导致的残差错位。

因此,我们认为等同于真实世界视频压缩伪影的伪影可以使用单个图像输入结合面向预测的压缩算法(例如,WebP 和H.264)。不需要真正连续的帧。为此,我们在图像退化模型中设计了一个面向预测的压缩模块。此模块需要视频压缩算法,以单帧为基础压缩输入。与VCISR [48]相比,一次执行压缩不需要多个帧。从工程应用的角度看,该方法在理论上是合理的,在实践中是可行的。在单帧输入的情况下,视频压缩简单地应用帧内预测来压缩帧,而不使用其帧间预测功能。利用这种方法,图像退化模型能够合成类似于在图7所示的传统多帧视频压缩中观察到的压缩伪像。随后,通过将这些合成图像馈送到图像SR网络中,系统可以有效地学习各种压缩伪影的模式并参与恢复。

随机调整模块大小:真实世界SR域中的退化模型考虑模糊、调整大小、噪声和压缩模块。模糊、噪声和压缩是真实世界中的伪像,可以使用清晰的数学模型或算法进行合成。但是,调整大小模块的逻辑完全不同。调整大小不是自然图像生成的一部分,而是仅出于SR配对数据集的目的而引入的。考虑到这个概念,我们认为以前的固定大小调整模块不是很适合。我们提出了一种更稳健和有效的解决方案,该方案包括在退化模型中以不同的顺序随机放置调整大小操作

3.3.动画手绘线增强

为了增强模糊的手绘线,直接采用全局方法(如修改退化模型或锐化整个GT)并不是理想的方法,因为网络无法在注意手绘线变化的情况下进行学习。因此,我们选择提取锐化的手绘线信息,并将其与GT合并,形成伪GT。通过将这种精心增强的伪GT引入SR训练,网络可以生成锐化的手绘线,而不需要引入额外的神经网络模块或单独的后处理网络。

为了提取手绘线,一种直接的方法是应用草图提取模型。然而,当前基于学习的草图提取通常以风格转移到参考图像为特征,这会扭曲手绘线条细节并包含不相关的像素内容(例如,CGI 效果的阴影和边缘)。因此,我们需要一个更细粒度的,逐像素的方法来提取手绘线。因此,我们利用XDoG [55],一种基于像素比像素高斯核的草图提取算法,从锐化的GT中提取边缘图。然而,XDoG边缘图被过多的噪声破坏,包含离群像素和碎片线表示。为了解决这个不适定的问题,我们提出了一个离群值过滤技术,加上一个定制设计的被动膨胀方法(在补充材料中详细介绍)。通过这种方式,我们产生了一个更连贯和不受干扰的手绘线表示。

我们经验性地发现,过度锐化的预处理GT使得手绘线边缘比其他不相关的阴影边缘细节更明显,这使得离群值过滤器更容易区分它们的差异。因此,我们提出了三轮unsharp掩蔽GT。综上所述,公式如下:
$$
I_{sharp}=f^n(I_{GT}) \
I_{Map} = h(g(I_{Sharp})) \
I_{pseudo-GT} = I_{Sharp} · I_{Map} + I_{GT} · (1 − I_{Map}),
$$

其中f是递归执行n次的锐化函数,g表示XDoG边缘检测,h表示具有离群值滤波的被动膨胀的后处理技术。IMap是一个二进制值映射。

3.4.动漫的平衡双感知损失

不需要的颜色伪影的存在归因于生成器和感知损失之间的训练中的不一致的数据集域。目前,大多数使用GAN训练的SR模型,包括AnimeSR和VQD-SR,使用相同的ImageNet [14]预训练VGG [39]网络作为感知损失。然而,动漫内容,尤其是混合了 CGI 和大量插图的内容,与 ImageNet 中的照片级真实感特征存在显著不同。为了解决这个问题,我们调查感知损失和随后的改进。感知损失背后的核心思想是利用高级特征(例如,分割、分类、识别)以通过比较中间层特征输出来补充低级像素特征。在这方面,我们使用预先训练的ResNet50对Danbooru数据集进行动漫对象分类任务,Danbooru数据集是一个丰富的标签动漫插图数据库。由于预训练的网络是ResNet50而不是VGG,因此我们提出了一个类似的中间层比较(详见补充材料)。总的来说,公式如下:

值得注意的是,引入基于ResNet的感知损失作为唯一的感知损失可以解决不想要的颜色伪影,并导致定量改进。但是,可能会出现视觉效果不佳的情况。这归因于Danbooru数据集中的固有偏差,其中大多数图像是人物脸或相对简单的插图。因此,我们寻求一个折衷,使用真实世界的特征作为辅助引物,以指导基于ResNet的知觉损失的训练。此方法可产生视觉上吸引人的图像,并且还解决了不想要的颜色问题。GAN训练的总损失函数如下:
$$
L = αL_1 + βL_{per} + γL_{adv}\
L_{per} = L_{ResNet} + δL_{VGG}
$$
其中,$L_1、L_{VGG}和L_{adv}$ 是L1像素损失、基于真实感VGG的感知损失和对抗损失。α、β、γ和δ为权重参数。

四、实验

4.1 实验细节

在我们的实验中,我们采用我们提出的API数据集作为图像网络的训练数据集。我们使用的图像网络是GRL 的一个微型版本,带有最近的卷积上采样模块(详见补充)。

为了训练GAN,我们遵循与先前工作相同的两阶段训练方法。在第一阶段中,我们训练具有L1像素损失的网络300 K次迭代。在第二阶段,我们引入了我们的平衡孪生感知损失和对抗性损失,进行了额外的300K迭代。{α,β,γ,δ}的权值分别为{1,0.5,0.2,1}。

对于ResNet,感知损失的层权重为{0.1,20,25,1,1},对于VGG,感知损失的层权重为{0.1,1,1,1}。

我们的鉴别器是与AnimeSR 和VQDSR 中相同的三尺度补丁鉴别器[23、35、51]。我们使用亚当优化器[28],第一阶段的学习率为2×10 - 4,第二阶段的学习率为1×10 - 4。在两个阶段中,每100 K次迭代应用一次学习速率衰减。

训练过程在一台Nvidia RTX 4090上进行,HR patch 大小设置为256 x256,batch_size 为 32。对于退化模型,我们首先对整个HR图像执行退化,而不是像先前的工作中那样直接对裁剪的块执行退化。在退化模型中,噪声和模糊的配置与Real-ESRGAN 相同,第一个面向预测的压缩是用JPEG [47]和WebP [38]实现的。第二种面向预测的压缩包括AVIF [19]、JPEG [47]、WebP [38]以及MPEG 2 [32]、MPEG4 [2]、H. 264 [36]和H. 265 [44]的单帧压缩。放置调整大小模块的概率在所有位置之间平均分配。具体参数设置详见我们的补充资料。

4.2.与最先进方法的比较

我们将我们的APISR与其他SOTA真实世界图像和视频SR方法进行了定量和定性比较,其中包括Real-ESRGAN 、BSRGAN、RealBasicVSR、AnimeSR 和VQD-SR 。

所有方法的比例因子均为4。为了验证我们方法的有效性,我们的评估基于AVC-RealLQ [56],其中有46个视频片段,每个片段有100帧。该数据集是唯一已知的用于真实世界动漫SR测试的数据集。对于无参考指标,我们采用了与VQD-SR和AnimeSR中相同的指标,即NIQE [34]和MANIQA [62]。我们还整合了其他基于SOTA学习的图像质量评估指标,如CLIPIQA [49]。所有指标均基于pyiqa[9]库。

表1 实验结果

如表1所示。我们的模型具有最小的网络规模(1.03 M参数),但在所有基于图像和视频的方法中,在所有指标上都具有SOTA性能。

同时,值得一提的是,我们仅以AnimeSR [56]和VQDSR [46]的13.3%和25%的训练样本复杂度实现了该结果。这尤其要归功于在数据集管理中引入了图像复杂度评估,该评估选择了信息丰富的图像,以提高学习动画图像表示的效率。此外,由于我们设计的显式退化模型,我们需要对退化模型进行零训练。

定性比较:如图10所示,与其他方法相比,APISR极大地提高了视觉质量。在恢复高度压缩的图像时,我们的模型比所有其他方法表现出了非凡的熟练度,如第一行所示,其中我们有更少的 ringing 伪影。此外,由于所提出的手绘线增强,我们生成的图像表现出增加的线密度和清晰度,如在第二行中所观察到的。

事实上,我们的模型在有效恢复方面优于其他模型,第三和第四行就是证明。这要归功于我们对图像退化模型的改进,我们在压缩和调整大小功能上提供了强大的恢复能力。同时,由于我们提出的平衡的孪生感知损失,由我们的GAN网络生成的图像不显示如在AnimeSR和VQD-SR中的不想要的颜色伪影。此外,由于我们提出的数据集中收集了多功能场景,我们能够在黑暗场景中实现有效的恢复。更多的视觉效果可以在补充材料中找到。

图10 部分内容

4.3 消融实验

推理数据集仍为AVCArealLQ [56]。目视比较见补充资料。

数据集的影响:我们用几个备选方案来替代我们的API训练数据集以进行比较分析:AVC-Train [56]、从与我们的API相同的视频源中随机选择的帧、具有IQA选择的 I-Frames 的集合、以及具有ICA选择的IFrames的集合。为了进行公平的比较,我们保持训练数据集大小的相似强度。如果我们将AVC-Train视频训练数据集作为图像数据集进行训练,我们将包括时间失真图像和信息较少的帧,这使得性能在所有指标上都难以与使用API训练的模型竞争。随机选择的图像数据集性能较差,因为它们缺乏对视频中高质量帧的关注。在我们的I-Frame集合中,我们去掉了时间失真的帧,并选择了压缩程度最低的帧,但基于IQA的选择限制了性能。在相同的训练迭代次数和条件下,基于ICA准则选择的数据集优于基于IQA-based选择的数据集。使用720 P重新缩放方法,动画图像比错误放大的版本具有更紧凑的手绘线条和CGI信息,这种回归原始的思维方式提高了所有指标的性能。

退化模型:为了验证退化模型的优越性,我们用Real-ESRGAN [54]中的高阶退化模型和BSRGAN [65]中的随机阶退化模型来代替我们提出的退化模型,这两种模型与我们的方法有一定的相似性。我们的降级模型与面向预测的压缩模型在MANIQA [62]和CLIPIQA [49]度量方面达到了显著的改进。通过我们的混洗调整设计,我们的网络对于各种真实世界的SR场景变得更加健壮,并且性能可以更进一步,尤其是NIQE [34]指标。

proposed Enhancement and Perceptual Loss的优势:我们将我们的模型与未使用所提出的手绘线增强和平衡的双感知损失进行训练的普通版本进行比较。我们引入的手绘线增强功能对CLIPIQA [49]进行了显著改进。当我们在GAN训练中添加ResNet感知损失时,它在NIQE中显示出显著的改善[34]。此外,通过在ResNet感知损失部分的早期层上进行建议的缩放,两种感知损失达到了稳定的平衡,性能进一步提高。这证明了一个与动漫领域兼容的感知缺失是非常有见地和教育意义的。

五、结论

本文充分利用动漫生产知识的特点,充分利用动漫生产知识丰富和提升动漫SR,提出了一种高质量、高信息量的面向动漫生产的图像(API)SR数据集,并进行了新颖的数据集策展设计。为了恢复和增强手绘线条,我们提出了一个图像退化模型来恢复视频压缩伪影和伪GT增强策略。我们通过引入一个用高级动画任务训练的网络来构建一个平衡的双感知损失,进一步解决了不需要的颜色伪影。大量的实验结果表明,我们优于现有的SOTA方法,在那里我们可以恢复更难的现实世界中的低质量的动漫图像。

SwinIR

相当经典的模型了

图像去噪和超分辨率重建——复现SwinIR网络训练自己数据集及推理测试(详细图文教程)-CSDN博客

详解SwinIR的论文和代码(SwinIR: Image Restoration Using Swin Transformer)_swinir代码-CSDN博客

图像超分辨率:SwinIR学习笔记 - 知乎

SwinIR: Image Restoration Using Swin Transformer论文笔记_swin transformer 降噪-CSDN博客

一、介绍:

问题:卷积神经网络有以下缺陷:图像和卷积核之间的交互内容无关,且在局部处理的原则下,卷积对于长距离依赖建模无效。

而Transformer引入后, ViT 的问题在于需要划分patch,具有以下缺点:边界像素不能利用patch之外的邻近像素进行图像恢复;恢复后的图像可能会在每个patch周围引入边界伪影,这个问题能够通过patch overlapping 缓解,但会增加计算量。

三、结构

SwinIR结构

主要分为三个部分:shallow feature extraction、deep feature extraction、highquality (HQ) image reconstruction modules。对所有的复原任务采用相同的 feature extraction modules,针对不同的任务采用不同的reconstruction modules。

这几个模块详解:

  • shallow feature extraction:首先用一个3×3卷积$H_{SF}$提取浅层特征$F_0$,$F_0=H_{SF}(I_{LQ})$

  • deep feature extraction:将提取到的浅层特征$F_0$,使用深层特征提取模块$H_{DF}$进一步提取特征。深层特征提取模块由 K 个Residual Swin Transformer blocks(RSTB)和一个3×3卷积构成。

    每个RSTB的输出$F_1, F_2, F_K$,以及输出的深层特征$F_{DK}$如式所示,式中$H_{RSTB_i}$表示第 i 个 RSTB模块,$H_{CONV}$表示最终的卷积层。卷积层能够将卷积的归纳偏置(inductive bias)引入基于Transformer的网络,为后续浅层、深层特征的融合奠定基础。

    $$
    F_i=H_{RSTB_i}(F_{i-1})\F_{DF}= H_{CONV}(F_K)
    $$

  • image reconstruction modules:以图像超分辨率为例,通过融合浅层特征$F_0$和深层特征$F_{DK}$来重建高质量图片$I_{RHQ}$,式中$H_{REC}$为重建模块。 $I_{RHQ}=H_{REC}(F_0+F_{DK})$

    浅层特征 $F_0$ 主要是包含低频信息,而深层特征则专注于恢复丢失的高频信息。SwinIR采用一个长距离连接,将低频信息直接传输给重建模块,可以帮助深度特征提取模块专注于高频信息,稳定训练。

    在图像超分辨率任务中,通过sub-pixel convolution layer将特征上采样,实现重建。在其他任务中,则是采用一个带有残差的卷积操作:$I_{RHQ}=H_{SwinIR}(I_{LQ})+I_{LQ}$

损失函数部分,图像超分辨率任务采用L1损失,通过优化SwinIR生成的高质量图像$I_{RHQ}$及其对应的标签$I_{HQ}$的来优化模型。$L=||I_{RHQ}-I_{HQ}||$,图像去噪任务和压缩任务采用Charbonnier loss,式中 ɛ 通常设置为10-3。

$L=||I_{RHQ}-I_{HQ}||^2+\epsilon^2$

Swin Transformer

如下图所示,Residual Swin Transformer Block (RSTB)由残差块、Swin Transformer Layers (STL)、卷积层构成。卷积操作有利于增强平移不变性,残差连接则有利于模型融合不同层级的特征。

image-20241126153159717

SwinTransformerLayer 和原版 Transformer 中 multi-head self-attention 的不同之处主要有局部注意力(local attention)和滑动窗口机制(shifted window mechanism)。首先,将大小为 $H×W×C$ 的输入特征reshape为 $(HW/M2)×M2×C$,即将其划分为 $HW/M2$个 $M×M$ 的local windows,然后对每个windows计算自注意力。

注意力计算公式如下:$Q = XP_Q, K= XP_K, V = XP_V$,该公式表示Query、Key、Value的计算过程,三个权重在不同的 window 间共享参数。

这个公式表示multi-head self-attention以及add and norm;第三个式子表示 feed forward network 以及add and norm。$X=MSA(LN(X))+X $、$X=MLP(LN(X))+X$

HAT

HAT(CVPR 2023):基于混合注意力机制的图像重建网络_hat注意力机制-CSDN博客

【图像超分辨率重建】——HAT论文精读笔记_hat模型-CSDN博客

CVPR 2023

摘要

Transformer 的潜力在现有网络中仍未得到充分利用。为了激活更多的输入像素进行重建,我们提出了一种新颖的混合注意力转换器 (Hybrid Attention Transformer)。它结合了**通道注意力(CAB)和自注意力(SW-MSA)**方案,从而利用它们的互补优势。此外,为了更好地聚合跨窗口信息,我们引入了重叠交叉注意模块(OCAB)来增强相邻窗口特征之间的交互。在训练阶段,我们额外提出了一种相同任务的预训练策略,以带来进一步的改进。

一、介绍

基于卷积神经网络(CNN)的方法获得了很好的效果,最近Transformer在NLP领域的成功带动了其在高级视觉任务中的发展,随后其在低级视觉任务方面也起到了很好的效果,尤其是Swin-Transformer。受到Swing-Transformer启发最近兴起的SISR算法是SwinIR。

“为什么 Transformer 比 CNN 更好”?一个直观的解释是,这种网络可以受益于自我注意机制并利用远程信息。然而,我们采用归因分析方法 LAM [14] 来检查 SwinIR 中重建所涉及的利用信息范围。有趣的是,我们发现 SwinIR 在超分辨率方面并没有比基于 CNN 的方法(例如 RCAN )利用更多的输入像素。此外,尽管 SwinIR 获得了更高的定量性能,但在某些情况下,由于使用的信息范围有限,它产生的结果不如 RCAN。这些现象说明Transformer对局部信息的建模能力更强,但其利用信息的范围有待扩展。

为了解决上述局限性并进一步开发Transformer在图像恢复中的潜力,提出了一种混合注意力转换器,即HAT。我们的HAT将渠道注意和 attention 机制结合起来,以充分利用前者对全局信息的利用能力和后者强大的代表能力。此外,我们还引入了重叠交叉注意模块,以实现相邻窗口特征之间更直接的交互。通过这些设计,我们的模型可以激活更多的像素进行重建,从而获得了显著的性能改善。

由于Transformer不像神经网络那样具有感应偏差,因此大规模数据预训练对于释放此类模型的潜力非常重要。本文提出了一种有效的同任务预训练策略。与IPT 使用多个恢复任务进行预训练和EDT 使用特定任务的多个退化水平进行预训练不同,我们直接使用同一任务的大规模数据集进行预训练。我们认为,大规模数据才是预训练的真正重要因素。仿真结果验证了所提方法的有效性。采用上述设计,HAT在SR任务上可以超过最新的方法很大的幅度(0.3dB 〜 1.2dB)。

问题:Transformer对局部信息的建模能力更强,但其利用信息的范围有待扩展,进一步开发Transformer在图像恢复中的潜力。

本文贡献:

  1. 将通道注意力引入 Transformer 以利用更多输入信息
  2. 提出了一个重叠的交叉注意力模块来更好地聚合跨窗口信息
  3. 提供了一个相同任务的预训练策略来进一步激活所提出的网络的潜力

二、相关工作

传统CNN:由于SRCNN首先将深度卷积神经网络(CNN)引入图像SR任务,并获得了比传统SR方法更上级的性能,因此许多深度网络已经提出了SR,以进一步提高重建质量。例如,许多方法应用更精细的卷积模块设计,如残差块(Residual Block)和密集块(Dense Block),以增强模型表示能力。一些研究工作探索了更多不同的框架,如递归神经网络和图神经网络。为了提高感知质量,一些方法引入对抗学习以生成更真实的结果。通过使用注意机制,在重建保真度方面实现了进一步的改善。最近,一系列基于Transformer的网络被提出,并不断刷新SR任务的最新技术水平,显示了 Transformer 强大的表示能力。为了更好地理解SR网络的工作机制,一些工作被提出来分析和解释SR网络。LAM 采用积分梯度方法来探索哪些输入像素对最终性能贡献最大。DDR 揭示了基于深度特征降维和可视化的SR网络中的深层语义表示。FAIG 被提出来为盲SR中的特定退化找到判别滤波器。引入信道显着图来证明Dropout可以帮助防止真实的SR网络的协同适应。SRGA 旨在评估SR方法的泛化能力。在这项工作中,我们利用LAM [23]来分析和理解SR网络的行为。

CV领域的Transformer:Transformer 在自然语言处理领域的成功而引起了计算机视觉界的关注。一系列基于 Transformer 的方法已经被开发用于高级视觉任务,包括图像分类,目标检测,分割等。虽然 viT 已经显示出其在建模远程依赖方面的优势,仍有许多工作证明卷积可以帮助 Transformer 实现更好的视觉表示。由于令人印象深刻的性能,Transformer 也被引入用于低级视觉任务。SwinIR、EDT是将Transformer技术应用到SISR的伟大尝试。现有工作仍然不能充分发挥 Transformer 的潜力,而本文方法可以激活更多的输入信息以实现更好的重建。

图像重建的目的是从劣化的图像中产生高质量的图像。由于深度学习已成功应用于各种图像恢复任务,例如图像超分辨率、图像去噪和压缩伪影减少,因此已提出大量深度网络用于图像恢复,在 Transformer 被应用于低级视觉任务并展示出令人印象深刻的性能之前,基于CNN的网络在该领域占据主导地位。例如,ARCNN 堆叠了几个卷积层,以构建用于JPEG压缩伪影减少的深度网络。DnCNN 采用卷积结合批量归一化的方法构造图像去噪深度网络。RDN 介绍了用于各种图像恢复任务的剩余密集CNN网络。在[73]中,研究了用于图像超分辨率的几十种CNN方法。随着Transformer在计算机视觉中的广泛应用,基于Transformer的图像复原方法也逐渐发展起来。SwinIR [22]基于Swin Transformer [16],在图像超分辨率、图像去噪和JPEG压缩伪影减少方面表现出色。Uformer [19]设计了一种U型Transformer网络,用于各种图像恢复任务。Restormer [20]基于转置的自注意构造了一个U型Transformer,并在多个图像恢复任务上实现了最先进的性能。与之前的基于CNN的方法相比,基于变压器的网络已经证明了上级的性能。此外,该方法还引入了混合注意机制,进一步提高了图像复原Transformer的性能。

三、具体工作

Swin Transformer已经在图像超分辨率方面表现出色。然后我们很想知道是什么让它比基于 CNN 的方法更有效。为了揭示其工作机制,我们采用了一种诊断工具——LAM,这是一种为 SR 设计的归因方法。

使用 LAM,我们可以判断哪些输入像素对所选区域的贡献最大。如图 2(a) 所示,红色标记点是有助于重建的信息像素。直观地说,利用的信息越多,可以获得越好的性能。比较 RCAN和 EDSR,这对于基于 CNN 的方法来说是正确的。然而,对于基于 Transformer 的方法——SwinIR,其 LAM 并没有显示出比 RCAN 更大的范围。

这与我们的常识相矛盾,但也可以为我们提供额外的见解。首先,这意味着 SwinIR 具有比 CNN 更强的映射能力,因此可以使用更少的信息来获得更好的性能。其次,如果 SwinIR 可以利用更多的输入像素,它仍有改进空间。 SwinIR 在蓝色框中标记的重建模式不如 RCAN。 通道注意力帮助RCAN看到更多像素,这对Transformer可能也有好处。
在 SwinIR 的中间特征图中观察到明显的块效应,如图 2(b)所示。这些伪影是由窗口分区机制引起的,这种现象表明移位窗口机制无法有效地建立跨窗口连接。一些针对高级视觉任务的工作也指出,增强窗口之间的连接可以改进基于窗口的自注意力方法。

基于以上两点,我们研究了基于 Transformer 的模型中的通道注意力,并提出了一个重叠的交叉注意力模块,以更好地为基于窗口的 SR Transformer 聚合跨窗口信息。
具体网络结构如下所示:

HAT结构

这里面一些比较重要的模块:

HAB 模块

标准Swin Transformer块的类似结构,并融入了Channel Attention。

增加 window size 大小为16,扩大窗口感受野,因为根据实验,限制窗口大小能节省计算成本,单通过移位窗口逐步增加感受野,却牺牲了自注意力机制的表征能力。

引入通道注意力机制,会激活更多像素,因为其涉及利用全局信息计算,有利于对纹理部分的优化。

overlapping window partition

使用像素token计算每个窗口特征内的交叉注意力。

大概:

  • 残差混合注意力组(RHAG)深层特征提取的基本单元
  • 混合注意力块(HAB)在STL的基础上添加了CAB,修改MSA为(S)W-MSA
  • 重叠交叉注意力块(OCAB)在STL的基础上将MSA替换为OCA(基于重叠窗口分区计算,查询更大窗口)

预训练ImageNet

IPT、EDT 等表明预训练在低级任务中起着重要作用。这些工作旨在探索多任务预训练对目标任务的影响。相比之下,我们基于相同的任务直接对更大规模的数据集(即 ImageNet )进行预训练。例如,当我们要为×4 SR训练一个模型时,我们首先在ImageNet上训练一个 ×4 SR模型,然后在特定的数据集上进行微调,比如DF2K。同任务预训练,更简单同时带来更多的性能提升。

值得一提的是,足够的预训练训练迭代次数和适当的小学习率进行微调对于预训练策略的有效性非常重要。我们认为这是因为 Transformer 需要更多的数据和迭代来学习任务的一般知识,但需要较小的学习率进行微调以避免对特定数据集的过度拟合。

四、实验

实验设置

  • 训练集:DIV2K+Flicker2K
  • 预训练:ImageNet
  • 网络详情:RHAG、HAB 均为6个,HAT-L中 RHAG 个数加倍
  • 比较指标:PSNR、SSIM(YCbCr)

不同窗口大小的影响

16*16的窗口效果最好,本文采用了该设置

HAT实验表

在x2, x3, x4倍数下与 EDSR, RCAN, SAN, IGNN, HAN, NLSN, RCAN-it ,比较,同时在预训练方法下与IPT、 EDT比较,均达到了最优的效果。具体数据见原文。

在同任务情况下,预训练表现更好,不仅在预训练阶段,在微调过程中也表现得更好。与特定任务的预训练相比,多任务预训练似乎削弱了性能。从这个角度来看,我们倾向于认为 “为什么预训练有效” 的原因是数据的多样性,而不是任务之间的相关性。

对将Transformer引入超分 SwinIR 算法进行改进,在 RCAN 的基础上结合通道注意力(RCAN)和自注意力(SwinIR),并提出OCAB。总体而言,HAT是基于Transformer、注意力机制的超分的优秀作品

CAMixerSR

CVPR 2024

CVPR 2024 | CAMixerSR:2K/8K/轻量级/全景图像超分又快又强!(字节&南开) - 知乎

摘要

为了满足对大图像(2K-8K)超分辨率(SR)的快速增长的需求,主流方法遵循两个独立的轨道:1)通过内容感知路由来加速现有网络,以及2)通过令牌混合器改进来设计更好的超分辨率网络。尽管直接,他们遇到不可避免的缺陷(例如,不灵活的路由或非区分处理)限制了质量-复杂度的进一步改进。

为了消除这些缺点,我们提出了一个内容感知混合器(CAMixer),它分配简单的上下文和额外的可变形的WindowsAttention稀疏纹理卷积集成这些计划。具体来说,CAMixer使用一个可学习的预测器来生成多个引导程序,包括用于窗口扭曲的偏移量、用于窗口分类的掩码和用于赋予卷积动态特性的卷积注意力,从而自适应地调节注意力以包含更多有用的纹理,提高卷积的表示能力。我们还引入全局分类损失,提高预测精度。通过简单地堆叠CAMixers,我们得到CAMixerSR,它在大图像SR,轻量级SR和全向图像SR上实现了高级性能。

一、介绍

最近对神经网络的研究显着提高了图像超分辨率(SR)质量[22,34,43]。然而,现有的方法可以生成视觉上令人愉悦的高分辨率 (HR) 图像,但在实际使用中,尤其是对于 2K-8K 目标,计算量很大。为了减轻开销,许多加速框架 [4, 19] 和轻量级网络 [14, 32] 被引入用于实际的超分辨率应用。然而,这些方法是完全独立的,没有合作。

第一种策略,加速框架[11,19,39],是基于观察到不同的图像区域需要不同的网络复杂性,从不同模型的内容感知路由的角度解决问题。如图1的中间图像所示,他们将大输入图像分解成固定的补丁patches,通过额外的分类网络将补丁分配给网络。ARM[4]通过引入基于LUT的分类器和参数共享设计来进一步开发该策略,以提高效率。尽管这些策略对所有神经网络都是通用的,但仍然存在两个不可避免的缺陷。一是分类不好,划分不灵活。图1显示了不正确地发送到一个简单模型的窗口,其中包含很少的细节。另一个是有限的接受域。如Tab.所示。2、将图像裁剪成小块限制了感受野,从而影响性能。

第二种策略,轻量级模型设计[7,8,17,44],专注于细化神经运算符(自注意或卷积)和骨干结构,以在有限的层内实现更强的特征表示能力,即,使用更多的内部信息来重建图像。例如,NGswin [5]利用N-Gram进行自我注意,以减少计算并扩大感受野。IMDN [14]引入了信息多重蒸馏以实现有效的块设计。虽然这些轻量级方法在720 p/1080 p图像上达到了令人印象深刻的效率,但它们的使用很少在较大输入(2K-8 K)下进行检查。此外,这些方法忽略了不同内容可以被区别处理的固有特性。

本文,首先整合上述策略,是基于不同的特征区域的需求不同程度的令牌混合器的复杂性的观察。简单卷积(Conv)可以与更复杂的卷积+自我注意(SA +Conv)类似地执行简单补丁。因此,我们提出了一个内容感知混合器(CAMixer)路由令牌混合器根据内容具有不同的复杂性。如图1所示,我们的CAMixer对复杂窗口使用复杂自注意(SA),对普通窗口使用简单卷积。从而以改进的分区精度和更好的表示来增强CAMixer。在CAMixer的基础上,我们构造了CAMixerSR,用于超分辨率任务。

为了全面检查CAMixer的性能,我们对轻量级SR,大输入(2K-8 K)SR和全向图像SR进行了实验。图2说明了CAMixerSR大大提高了轻量级SR和加速框架。

贡献总结为:

  • 提出了一个内容感知混合器(CAMixer)集成卷积和自注意,它可以通过分配简单的区域卷积和复杂的区域自适应地控制推理计算。
  • 我们提出了一个强大的预测器来生成偏移,掩码和简单的空间/通道注意力,它调制CAMixer以捕获更长范围的相关性,只需更少的计算。
  • 基于CAMixer,我们构建了CAMixerSR,它在三个具有挑战性的超分辨率任务上表现出最先进的质量计算权衡:轻量级SR,大输入SR和全向图像SR。

二、相关工作

SR的加速框架:随着复杂度的不断扩大,以获得更好的恢复质量,SR模型的实际应用变得更加困难,特别是对于2K-8K SR。最近的研究[4,19,39]从不同的角度解决了这个问题。他们没有设计轻量级模型,而是使用内容感知路由将裁剪的补丁动态发送到具有不同复杂性的模型。ClassSR [19]利用3类分类器来确定由复杂/中等/简单网络计算的子图像,这为RCAN [43]在8 K数据集上节省了50%的计算。PathRestore [39]学会了根据上下文选择特征路径来适应FLOP。

轻量级超分:自第一项工作以来,SRCNN [7]在超分辨率任务中使用卷积神经网络(ConvNet),已经提出了许多降低复杂性的策略[7,14,23,34],以实现更轻量级的推论。早期的DRCN [16]和DRRN [31]试图通过使用循环块来减少参数,但计算量很大。为了克服这一缺点,IDN [13]和IMDN [14]采用了高效的信息融合结构,以减少参数和计算量。后者是ConvNet,例如,EFDN [32]和RLFN [18]进一步简化了信息提取过程,并引入了重新参数化,以在移动设备上获得实时推断。随着近来Transformer的快速发展,各种强大的token混合器,自注意[41,42]和大核卷积[33,45]被引入到轻量级SR中。例如,SwinIR [21]采用基于窗口的SA,MAN [33]采用大核卷积,这两种算法都实现了SOTA性能。虽然这些神经算子能够捕捉长程相关性,但它们需要大量的计算。为此,本文将内容感知路由与令牌混合器设计相结合,在信息区域采用复杂算子,而在普通区域采用简单算子。

SCNet

哈工大江俊君团队 | SCNet:利用全1X1卷积实现轻量图像超分辨率 - 智源社区

202406

摘要

深度模型在单图像超分辨率 (SISR) 任务上取得了显著进展,尤其是具有大内核 (3 × 3 或更大) 的大型模型。然而,这种模型的计算量很大,阻碍了它们在实时、资源受限的环境中部署。相反,1 × 1 卷积带来了显著的计算效率,但在聚合局部空间表示方面却举步维艰,这是 SISR 模型的基本能力。

为了应对这种矛盾,我们建议协调 3 × 3 和 1 × 1 内核的优点,并挖掘轻量级 SISR 任务的巨大潜力。具体来说,我们提出了一个简单而有效的完全 1 × 1 卷积网络,称为基于 Shift-Conv 的网络 (SCNet)。通过结合无参数的空间移位操作,它为完全 1 × 1 卷积网络配备了强大的表示能力,同时具有令人印象深刻的计算效率。

大量实验表明,尽管 SCNets 采用完全 1 × 1 卷积结构,但它的性能始终与采用常规卷积的现有轻量级 SR 模型相当甚至超过后者。代码和预训练模型可在 https://github.com/Aitical/SCNet 找到。

关键词:轻量级网络、图像超分辨率、卷积神经网络、Transformer、图像恢复

一、介绍

单幅图像超分辨率 (Single image super-resolution, SISR) 旨在从其对应的退化低分辨率 (LR) 图像重建高分辨率 (HR) 图像。随着深度学习的快速发展,它取得了实质性的进步,并在研究界引起了更多的关注[1, 2]。开创性的工作 SRCNN [3] 提出通过卷积神经网络 (CNN) 学习从 LR 输入到 HR 输入的映射,并且优于传统方法。随后,许多基于 CNN 的工作探索了更有效的架构 [4-7]。除了 CNN 架构之外,还提出了基于Transformer的架构 [8] 并实现了最先进的 (SOTA) 性能。

然而,上述模型通过非常深或复杂的网络架构来提高 SISR 性能,导致参数量和计算成本负担沉重。这使得它们难以在资源受限的环境中部署,例如移动或边缘设备。

因此,对高效轻量级 SR 模型的需求很高。许多工作已经提出减少参数或浮点运算 (FLOP) 的数量,以实现 SISR 的轻量级神经网络 [9–14]。3×3 卷积运算是基于 CNN 的模型中使用最广泛的运算,因为它有利于平衡模型容量和计算成本。虽然更大的卷积核可以提高性能,但代价是参数数量和计算成本的快速增加 [15, 16]。相反,大小为 1×1 的较小内核可以减少参数数量,但由于固定的感受野和没有与相邻像素的局部特征聚合,因此会削弱学习能力。这引出了一个自然的问题:我们能否实现两全其美,并构建一个完全 1×1 卷积的轻量级但有效的 SR 模型?当直接用 1×1 卷积替换 3×3 卷积时,固定的接受域和局部特征聚合的缺失会损害模型。

为了解决这个问题,我们在本文中提出了一种新方法,通过空间移位扩展 1×1 卷积。值得注意的是,空间移位操作是非参数的,不需要额外的 FLOP,这使得它有利于高度优化的实际应用 [17, 18]。具体来说,我们沿通道维度将输入特征图分成不同的组,然后对具有不同空间方向的每个组应用空间移位操作。它确保生成的特征图中的每个像素都围绕通道维度的特征组装,从而弥补了与 3×3 卷积在表示能力方面的差距,如图 3 所示。我们将这种通过空间移位操作进行局部特征聚合的扩展 1×1 卷积称为 Shift-Conv 层(或为简单起见称为 SC 层)。与普通的 3×3 卷积相比,SC 层在保持相当性能的同时显著减少了参数数量。

当我们在大约八个方向上将步幅设置为 1 时,SC 层中的 stride 和方向超参数可以类似于普通 3×3 卷积中的超参数。值得注意的是,可以通过选择自适应位置(甚至像可变形卷积 [19] 一样)来实现不同的空间先验。不同空间先验的灵活性使 SC 层能够减少参数,同时扩展普通 3×3 卷积的感受野。继广泛使用的残差块 [5] 之后,我们提出了一个移位卷积残差块,简化为 SC-ResBlock。此外,我们提出了一个由多个 SC-ResBlocks 堆叠的轻量级网络,称为 SCNet。由于 SC 层中的参数量很少,所提出的 SCNet 可扩展到不同的模型大小,并提供更多机会来利用更宽或更深的架构。我们分别介绍了三种具有不同模型大小的 SCNet:微小 (T)、基础 (B) 和大 (L)。此外,所提出的 SCNet 可以灵活地与广泛的模块(例如广泛使用的注意机制)进行插值,为进一步研究提供了巨大的潜力。图 1 显示了所提出的 SCNet 在 Manga109 测试数据集 (×4) 上与其他不同大小的模型相比的性能。结果表明,所提出的 SCNet 在 SR 结果和参数数量之间实现了更好的权衡。

在深入研究细节之前,我们总结了我们工作的主要贡献:首先,我们提出了第一个完全基于 1×1 卷积的 SISR 深度网络,为轻量级架构的设计提供了新的启示。其次,我们研究了普通 3×3 卷积中的特征聚合,并通过针对通道维度的手动空间移位操作扩展了具有局部特征聚合的 1×1 卷积。最后,我们展示了大量实验结果,验证了所提出的 SCNet 的优越性,以及详细的消融研究,有助于理解各种组件的影响和所提出的 SCNet 的可扩展性。

在接下来的章节中,我们将首先在第2节中给出轻量级图像超分辨率方法的一些相关工作。在第3节中,我们将详细介绍和解释我们提出的SCNet。然后,第4节描述了我们的训练设置和实验结果,其中我们比较了我们的方法与其他最先进的方法的性能。最后,本文在第五章中总结了一些结论。

二、相关工作

最近,深度学习方法在 SISR 任务中取得了显著的进步 [20, 21]。特别是对于基于 CNN 的模型,各种精心设计的 CNN 架构都在探索如何进一步提高 SISR 性能 [5, 22, 23]。此外,像通道注意 [24] 这样的注意机制也被引入到了 SISR 任务中 [25–27]。最近,VisionTransformer引起了极大的关注 [28, 29],许多工作都提出了探索实现 SOTA 性能的基于Transformer的架构 [8, 30, 31]。除了涵盖架构之外,人们还努力利用更多的学习模式来利用 SISR 任务,例如神经网络修剪 [32]、对比学习 [33, 34] 和知识提炼 [35]。赵等人 [36] 开始对合适的目标函数进行实证检验。 Wu 等人 [33] 创新了用于低级 SR 任务的对比学习框架,为现有方法的性能提供了额外的提升。这些改进 SISR 的多样化方法继续推动着这一复杂领域的发展。

与通过快速增加参数数量和计算成本来实现性能提升相反,许多轻量级 SISR 模型已通过减少参数得到利用,尤其是对于资源有限的设备 [10–13, 37–39]。Hui 等人提出了一种深度信息蒸馏网络 (IDN) [37],并将其扩展为信息多蒸馏网络 (IMDN) [38]。Zhang 等人 [12] 通过重新参数化策略提出了一种实时推理 SR 网络。Li 等人 [40] 提出了一种计算复杂度低的超轻量级模型,称为 s-LWSR,它使用对称架构、压缩模块和减少激活。他们通常利用正常的 3×3 卷积,并尝试开发精心设计的模块来提升性能。

去年,有几项工作研究了一些基于 CNN 的现代架构 [15, 16]。刘等人探索了一种基于 CNN 的现代架构,并引入了使用 7×7 卷积核大小的更大。丁等人进一步将内核大小提高到 31。与正常的 3×3 卷积相比,更大的内核带来更大的感受野,这显著提高了基于 CNN 的网络的能力。最近,刘等人 [41] 利用轻量级 SR 网络中的大内核,利用通道混洗操作进一步减少可学习特征的数量。

空间移位操作广泛应用于各种计算机视觉任务。现有的一些研究,如[18、42、43],已经探索了空间移位操作在高级任务中的应用。吴等人[42]首次在卷积中引入移位操作,并提出了一种紧凑的CNN模型。随后,[18、43]提出了自适应和稀疏移位操作。此外,林等人[17]引入了视频中时间特征聚合的移位操作。在图像超分辨率领域,张等人[44]引入了高效的长距离注意网络(ELAN),在其前馈网络中加入了空间移位操作,以增强局部特征聚合。然而,我们的工作与众不同,从根本上重新构想了具有完全1×1卷积的网络架构。与将空间移位操作作为次要组成部分的现有方法不同,我们的方法重新定义了基本的网络架构。这种新颖的设计强调简单性和效率,为超分辨率成像领域做出了独特的贡献。

在本文中,我们专注于探索一种用于轻量级 SISR 任务的有效卷积模型,具体方法是将基于 3×3 卷积的模型转换为完全 1×1 卷积模型。然而,1×1 卷积缺乏局部特征聚合,无法有效学习。为了应对这一挑战,我们提出了一种有效而高效的 SCNet,它采用基本的组移位策略进行局部特征聚合。此外,我们提供了详细的基准比较和消融研究,展示了 SCNet 在开发高效 SISR 模型方面的潜力。我们相信我们的工作将有助于为研究界开发高效的 SISR 模型。

三、Method

在本节中,我们将详细介绍我们建议的SCNet。我们开始介绍SISR任务的一般框架。随后,我们给出了SCNet中不同组件的实现细节。

许多基本SR-ResBlocks堆叠了所提出的SCNet的主要骨干,然后是放大层以重建高分辨率(HR)结果。

给定LR图像$LR ∈ R^{C×H×W}$,其中H、W和C分别是图像的高度、宽度和通道数。该方法首先利用普通的1 × 1卷积作为浅层特征提取器,将图像空间映射到潜在空间。浅提取器被记为$N_{head}$,潜在特征是$f_{head} = N_{head}(LR)∈ R^{C_{latent}×H×W}$,其中$C_{latent}$是潜在空间的通道维度。主干$N_{main}$由许多基本的SC-ResBlocks堆叠,这些基本的SC-ResBlocks由shift-conv和1×1卷积层实现,取代了正常残差块中的3×3卷积层[5]。这里,主干$N_{main}$将浅层特征$f_{head}$作为输入,并提取深层特征$f_{main} = N_{main}(f_{head})$。然后,给定提取的深度特征$f_{main}$,利用放大模块来重建HR结果。我们采用SC层,ReLU,1×1卷积和像素混洗操作来构建放大模块$N_{rec}$,并利用正常的1×1卷积将放大的特征映射到3个通道的输出中。此外,我们通过双线性插值将放大的LR图像相加,超分辨率输出为$I^{SR} = N_{rec}(f_{main})+ Bilinear(I^{LR})$。最后,通过最小化L1损失来训练SR网络。

空间移位

让我们把移位方向记为d ∈ {1,0,−1},并分别取每一边的$d_h$和$d_w$。然后,我们可以通过将方向和步幅组合为step =($d_h * s_h$,$d_w * s_w$)来获得空间移位步长,并且空间移位步长的集合是S = {$step_i$,i = 1,…,n},其中n是组合特征的数量,$step_i$表示第i个局部像素方式特征的步长。如果我们想要像普通的3 × 3卷积那样在周围取8个局部像素,则空间移位步骤的集合可以被定义为{(0, 1), (0, −1), (1, 0), (1, 1), (1, −1), (−1, 0), (−1, 1), (−1, −1)}。我们利用$step_i$来定位目标像素特征,即使距离很长,我们也可以在任何地方利用像素(只需分配一个大的步幅值)。此外,通过设置不同的空间平移步长,可以采用不同的局部聚合方案。为了公平比较和评估完全1 × 1卷积SCNet的有效性,我们将像正常的3 × 3卷积层一样的局部8像素作为默认值。

给定输入特征f,我们将其沿着信道维均匀地分成n组,其中n = S,n个较细的张量$f^i ∈ R^{\frac{Clattent}{n} ×H×W,i = 1,…,\frac{Clattent}{n}}$得到类n.然后,对每个分离的特征组按给定的步长参数进行移位,得到移位后的特征$f_{shift}$。$f_{shift}$中的每个像素特征包含沿着通道维度围绕其的局部特征。图3中示出了空间移位操作的细节。在算法1中给出了空间移位操作的实现。在这里,我们采用了基于Pytorch的普通Python实现来进行模型训练。给定输入特征f,用超参数移位步长对其进行分离和移位,并且我们将用于填充的恒定零值作为默认值。

Shift-Cover Layer:由于1 × 1卷积运算是对单个像素特征进行的,会影响到模型的建立,因此本文通过一个简单的空间移位运算来显式地研究局部特征聚合,该运算不涉及参数和浮点运算。Shift-Conv层(简化为SC层)由1×1卷积层和空间移位操作堆叠而成,因此SC层扩展了常规的1 × 1卷积,具有局部特征聚集和较少的参数。

Shift-Cover Residual Block。如图4(a)所示,[5]中提出的残差块广泛用于SR网络。为了公平比较,我们修改并引入SC-ResBlockSCResBlock包含SC层、ReLU和1 × 1卷积。与基于3×3卷积的残差块相比,我们的SC-ResBlock仅采用1 × 1卷积,显著减少了参数数量和计算成本。

备注:基于深度学习的SISR技术取得了显著的进步,但同时其性能也日趋饱和。在这项工作中,我们没有探索更复杂的网络结构,而是回顾了最小CNN单元,并提出了一个轻量级的SCNet,它使用了完全1×1卷积来减少参数和计算成本。空间移位操作在视觉任务中不是新的,并且已经被有效地应用于高级视觉任务[17,18,42]。值得注意的是,这项工作的目标并不是提出一种新颖的运算算法。相反,我们尝试构建一个基准SR网络,它只包含最简单的特征聚合(空间移位操作)和最简单的特征提取(1 × 1卷积)。希望本文的研究能够为图像复原任务的网络设计,特别是轻量级架构的设计提供一些新的思路。

四、实验

在这一部分中,我们将描述详细的评估实验。首先,我们介绍了实验设置和对比方法。然后在SOTA轻量级方法和我们提出的方法的一些公开数据集上给出了定量和定性的结果。此外,我们还提供了深入的比较,以评估所提出的SCNet在推理延迟方面的效率。最后,我们通过烧蚀实验分析了不同成分的影响,特别是对移相层的影响。此外,我们还对SCNet的可扩展性进行了评估,将扩展的模块应用于SCNet。

实验设置

训练设置:对固定大小为64×64的图像块进行裁剪训练,对对应的LR块进行双三次插值下采样。通过随机水平翻转和旋转来增强所有的训练面片。我们将批量设置为32,并使用ADAM [49]优化器,设置β1 = 0.9,β2 = 0.999。初始学习率设定为2 × 10−4。

数据集和指标:在[39,41]之后,我们从DIV2K [50]中获取800个图像并从Flickr 2K中获取2650个图像用于训练。测试数据集包括Set5 [51]、Set14 [52]、B100 [53]、Urban100 [54]和Manga109 [55],放大系数为2、3和4。为了进行比较,我们在变换后的YCbCr空间的Y通道上测量峰值信噪比(PSNR)和结构相似性指数度量(SSIM)。

比较方法:我们将所提出的SCNet与代表性的高效SR模型进行了比较,包括SRCNN [3]、VDSR [22]、LapSRN [45]、DRRN [23]、CARN[10]、IMDN [38]、LAPAR [39]、SMSR [11]、ECBSR [12]、LBNet [47]、FDIWN [13]和ShuffleMixer [41],这些模型分别针对×2、×3和×4上尺度任务。

实验结果

得益于SC层中参数的极少,我们有更多的机会去探索不同的体系结构。详细地说,我们利用基本的SC-ResBlock简单地堆叠,开发了三个具有不同模型大小的SCNet,它们包含高达128个通道的较大潜在维度和高达64个块的更深结构。(并不比SMFANet好)

定量评价:表1中比较并报告了不同SR模型在尺度为2、3和4的五个测试数据集上的性能。与PSNR和SSIM结果沿着,我们还报告了参数量Params。除了LAPAR-B [39]之外,当参数数目小于400 k时,我们的SCNet-T优于所有的微小模型,证明了它的有效性。可以合理地指出,LAPAR-B包含的参数几乎是原来的两倍。当参数的数量在400 k到800 k之间时,SCNet-B在所有尺度上都优于一些较大的模型,如IMDN [38]、LAPAR-A [39]和FDIWN [13]。具体而言,与LBNet [47]相比,SCNet-B在除Set 5之外的所有测试数据集上都获得了更高的结果,LBNet包含了设计良好的架构和更多的参数。此外,根据表1中的平均性能,可以观察到SCNet-B在所有规模上都与现有模型相当,甚至优于现有模型,尤其是对于x4 SR任务。这有效地证明了我们的SCNet仅依赖于1 × 1卷积的能力,能够熟练地处理SR任务的局部特征聚合。

最后,所提出的SCNet-L优于DRCN [46]、CARN[10]、SMSR [11]和SRResNet [4],并在所有测试用例中获得了新的SOTA性能。与IMDN和SRResNet相比,SCNet-L在PSNR和SSIM方面分别获得了0.26/0.0047和0.28/0.0062的显著增益,证明了其有效性和可扩展性。得益于SC层中的极少数参数,我们有更多的机会探索不同的架构。详细地说,通过基本SC-ResBlock简单地堆叠,我们利用了具有不同模型大小的三个SCNet,其利用了高达128的更大潜在维度和高达64的更深层。我们假设,通过检查不同架构的结果,我们可以更深入地了解所建议的SCNet及其性能细微差别。

SCNet的效率:此外,我们还在表2中报告了计算比较结果,并表明与LAPAR [39]、ShuffleMixer [41]、SRResNet [4]和基于变压器的ELAN [44]相比,SCNet在性能、参数计数和FLOP之间实现了更好的平衡。虽然ShuffleMixer的复杂性较低,但我们的SCNet采用了简单而有效的残差架构,在轻量级超分辨率领域建立了新的基准。这项工作重点关注SR体系结构的基础方面;探索更复杂的操作将留待将来进行。值得注意的是,SCNet展示了相对于基于CNN的SRResNet的显著改进,强调了我们的Shift-Conv层的有效性。此外,我们的结果揭示了基于CNN的方法和基于Transformer的ELAN之间的显著性能差距。然而,SCNet作为一个重要的桥梁,缩小了这一差距,并展示了简单性和效率的良好融合。

移位操作不需要额外的计算开销,因此在设计轻量模型方面具有很好的应用前景。对于我们提出的SCNet,它包含了全部的1×1卷积,我们发现,通过根据移位步长重新索引矩阵点积的输出值,可以将1×1卷积和SC层中的空间移位操作融合为一个最优操作。为了评估这种融合,我们采用了广泛使用的C++推理库NCNN,结果如表3所示。所有型号都是从其正式发布版本转换而来,没有进行额外的优化。

值得注意的是,SCNet只包含一种类型的计算操作(1 × 1卷积)。这种简单性使其友好而实用地实现了优化的实现,我们相信这将使其适合未来的实际应用。

一般而言,具有所有1×1卷积的SCNets与具有较大模型尺寸的正常3×3卷积的SR模型获得相当甚至更好的结果,这证明了所提出的SCNets的有效性。在这方面,我们相信有更多的机会来开发基于所提出的SCNet的轻量级图像恢复的高效架构。

定性评价:我们对我们提出的SCNet-L与五个代表性模型(包括LapSRN [45]、VDSR [22]、DRCN [46]、CARN[10]和IMDN [38])之间的SR结果进行了视觉质量比较,以执行×2、×3和×4的放大任务。Urban 100测试数据集上的×4 SR结果如图5所示。与SCNet-L相比,CARN和IMDN的重建结果较为模糊,伪影较多,而SCNet-L的重建结果能够恢复出纹理清晰的主要结构。此外,在图6中给出了具有不同模型容量的建议SCNet的结果。当我们看一下图像“BokuHaSitatakaKu”时,我们可以发现,与IMDN或CARN的结果相比,即使是SCNet-B也可以实现更清晰的字符。

消融实验

本文的核心贡献是为SISR提出了一个完全1 × 1卷积网络。为了更好地了解SCNet不同组件的影响,本节介绍了全面的消融研究。

SCLayer中Step的影响:与常规的3×3卷积相比,1×1卷积缺少空间特征聚合。为了解决这个问题,我们引入了空间移位操作来聚合局部特征。超参数平移步骤(The hyper-parameter shift step)是一个关键步骤,它决定了局部像素的聚集,在此过程中起着关键作用。为了更好地理解移位步长的影响,我们采用了我们的基本模型,即具有16个SC-ResBlock和128个通道维度的SCNet,并使用五种不同的移位步长设置对其进行重新训练,如图7所示。第一和第二图案分别涉及来自水平和垂直方向(Shift 4-Cross)和对角线方向(Shift 4-Diag)的四个局部位置。其余的图案是密集的8像素(Shift 8)、扩张的8像素(Shift 8-Dilated)以及联合收割机了Shift 8和Shift 8-Dilated的16像素(Shift 16)。我们在表4中报告了结果。我们利用LAM [56]来可视化不同空间步长的感受野,如图8所示。一般而言,我们观察到局部特征聚合在以下三个方面是关键的。

相邻要素聚合:Shift 4-Cross和Shift 4-Diag模型的性能均低于Shift 8模型,表明Shift 4-Cross和Shift 4-Diag模型的特征聚合模式是互补的,而相邻像素的聚合,如正常的3×3卷积,是SR网络的必要条件。我们观察到,Shift 4-Diag可以在SR网络中实现成功的学习,但是它导致最差的性能,可能是由于在空间移位操作期间的信息丢失。

接受场Receptive Field:基于默认的Shift 8步长,我们将其扩展为Shift 8Dilated,如图7(d)所示。除了Urban 100之外,扩展后的SCNet的性能略好于默认值。根据图8,可以通过Shift 8-Dilated获得更大的感受野,这表明可以通过空间移位步骤获得不同的特征聚集模式,如正常的扩张卷积。

组维Group Deminsion:此外,我们将默认的Shift 8与Shift 8Dilated组合以获得Shift 16,如图7(e)所示。与Shift 8和Shift 8Dilated相比,使用Shift 16的SCNet获得了更大的感受野,但性能更差,如图8和表4所示。我们将其归因于每个移位组的特征维数减小,这妨碍了特征提取。由于潜在特征的维数是固定的,因此Shift 16中的移位组维数是Shift 8和Shift 8-Dilated的移位组维数的一半。如图8所示,我们可以观察到,仍然存在较大的激活区域,但激活值较小。

模型容量的影响:得益于SC层中的少数参数,有机会探索SCNet的更多深度和宽度。在此,我们利用堆叠了不同SC-ResBlock的SCNet来分析模型容量的影响。如表5中所总结的,我们通过具有不同块(简化为B)和通道尺寸(D)的SC-ResBlock构建我们的SCNets。在比较具有相同通道尺寸(例如64个通道)的SCNet时,我们发现更深的架构产生更好的结果。当我们比较B64D64和B16D128时,我们可以发现B64D64以更少的参数获得了更好的性能。我们认为,B64D64具有更大的感受野和更多的局部特征聚集,而B16D128缺乏浅层结构,这是由于B64D64的局部特征聚集场。此外,采用B32D128的最大规模SCNet也获得了最佳性能.如图9所示,可以发现B32D128比B32D64获得更多的激活像素,这表明组维数对特征聚合也有很大的意义。在深度和宽度(组维度)之间的权衡可以在未来进一步探索。此外,图10显示了更深架构和更大通道尺寸的详细消融,证明SCNet可扩展至更大的模型容量。

可扩展性

如前所述,本文的主要目标是通过堆叠大量Shift-Conv层来提出一个新的基准SR网络SCNet。通过应用空间移位操作,SCNet可以实现与现有先进方法相当的性能。为了全面探索SCNet模型的潜力,我们通过一系列严格的实验对其可扩展性进行了彻底的评估。这种详尽的分析使我们能够更好地了解我们提出的模型的影响,并证明其显着的可扩展性。

广泛的注意力模块:注意力机制已被证明在基于CNN的方法中起着至关重要的作用,特别是对于轻量级模型。为此,我们扩展了所提出的具有通道注意力(简化为CA)、空间注意力(SPA)和像素注意力(PA)的SCNet,如图11所示,并在表6中呈现结果。我们可以发现,空间注意力,它包含的参数比信道注意力少,实现更好的性能。总的来说,我们可以得出结论,所提出的SCNet是可扩展的注意力模块,这可以带来进一步的改进。这些结果验证了基于vanilla残差块的SCNet可以有效地适应注意机制,这突出了未来探索SCNet精心设计的架构的潜力。

上采样模块的影响:与传统的基于CNN的方法不同,SCNet只使用1 × 1卷积并简化了重建模块。为了评估Shift-Conv对不同升级策略的适应性,我们使用各种升级方法进行了调查。为了进行公平的比较,我们将SCNet-T作为默认模型,并使用不同的放大策略修改重建模块,如图12所示。如表7所示,参数稍多的pixelshuffle模块在所有测试数据集上的性能最佳。具体而言,与次优方法相比,具有PixelShuffle的SCNet在Urban100和Manga109上分别获得了0.10 dB和0.11 dB的改善。

广泛的SR任务:为了全面评价SCNet的有效性,我们在8. 0的比例因子上进行了实验。结果如表8所示,这证实了所提议的SCNet的效率和有效性。

在大量的实验中,我们使用通道注意、空间注意和像素注意等注意机制来增强SCNet。应用此扩展模块可提高性能。此外,我们还评估了SCNet中各种上尺度模块的影响,揭示了我们提出的完全1×1卷积对不同上尺度方法的通用性。最后,为了进一步检验其有效性,我们使用更大的缩放因子8进行了实验,该缩放因子提供了稳健的性能,增强了其在高要求超分辨率任务中的效率和有效性。

讨论和限制

在本节中,我们将进行定量和定性比较,以展示所提议的SCNet的有效性。此外,我们还提供了全面的消融来分析SCNet中各种组件的影响,包括感受野、空间扩展和组维度之间的权衡以及扩展模块。这些结果提供了深入的见解,并表明所提出的SCNet具有很大的进一步研究潜力。

虽然所提出的SCNet有效且高效地解决了轻量级SISR问题,但未来仍有挑战需要解决。本文仅探讨了基于vanilla剩余连接的体系结构。如表1和图11所示,我们认为设计良好的架构可以进一步增强模型功能,例如最近的CNNs中的大型内核设计和Transformer中的远程建模,但这超出了本文的范围。此外,如图8和表4所示,SCNet在获得更大感受野方面是可扩展的。然而,更复杂的机制,如适应性转移,在未来是更有意义的研究。

五、结论

在本文中,我们摆脱了设计日益复杂的网络架构的传统方法,而是选择了一个名为SCNet的极简主义和完全1 × 1卷积网络,从而显著降低了参数和计算成本。尽管如此,1 × 1卷积也带来了自己的挑战,主要是缺乏局部特征聚合,这是有效建模的一个关键方面。为了克服这个问题,我们将1 × 1卷积扩展到Shift-Conv层。通过结合空间移位操作,它有助于沿着通道维度沿着进行局部特征聚合,而不会增加计算开销。我们的全面实验表明,SCNet可以匹配甚至优于现有的先进方法。此外,深入的分析强调了SCNet作为一个强大的baseline架构的多功能性和可扩展性。我们希望我们与SCNet的合作将点燃ignite研究界的进一步探索,鼓励先进的本地和远程特征聚合模式的发展。

OSFFNet

AAAI-2024 未开源

深度卷积重思考|BSConv - 知乎

摘要

近年来,在资源受限的设备上实现单幅图像超分辨率(SISR)的轻量级方法已经被提出。然而,这些方法主要集中在简化网络结构,而没有充分利用浅层特征。事实上,浅层特征包含了超分辨率任务的关键细节,包括边缘、纹理和颜色。因此,有必要开发一种能够有效集成不同层次的特性并利用它们之间的互补性的新架构。首先分析了经典轻量级SR方法中多阶段特征与恢复任务之间的关系。在此基础上,本文提出了一种融合原始图像叠加初始化、浅层特征全局连接和多接收场动态融合的全阶段特征融合(OSFF)结构。为了提高模型的性能,还设计了一个注意力增强的特征提取模块。最后,利用这些贡献,我们构建了一个全阶段特征融合网络(OSFFNet)。在2个基准数据集上的实验结果表明,本文算法在保持快速、无训练等优点的同时,检测性能优于目前主流算法。值得注意的是,在Urban100数据集上,对于×2 SR,与次优方法相比,它实现了0.26dB的PSNR改善。

一、介绍

作为低层视觉方法的一个典型分支,单图像超分辨率(singleimage super-resolution,SISR)的目标是从退化的低分辨率(low-resolution,LR)图像重建高分辨率(high-resolution,HR)图像。与传统方法相比,深度学习(DL)方法由于其可学习的特征表示而获得了出色的性能和逼真的视觉效果(Wang,Chen和Hoi 2020)。因此,一些研究旨在通过增加卷积层或采用复杂的网络拓扑来提高图像恢复质量。这些特征通常限制了实际应用,因为资源受限的移动的设备与密集SR方法斗争。因此,设计轻量化、高效的SR模型已成为一个重要而又具有挑战性的问题。

研究人员已经提出了几种轻量级和高效的SR方法来解决这一挑战。这些方法的主要思路是设计有效的网络结构,这涉及到诸如参数共享、特征提取、注意力机制和卷积优化等策略。这些SR方法成功地平衡了重建性能和计算成本。然而,这些网络通常依赖于顺序简化网络结构来提高计算效率,这导致了在前向传播过程中低层特征的利用不足。图1显示了IMDN(Hui et al. 2019)中的特征图如何包含详细信息,低层特征强调网络输入附近的边缘和纹理,而深层特征则侧重于提取输出附近细节较少的局部特征。忽略底层特征可能会导致关键细节的丢失,从而影响SR模型的性能。因此,需要设计一种新的网络架构,以有效地整合来自不同阶段的特征图,并利用它们的互补性。这样的架构将能够保持计算效率并增强SR性能。为此,本文提出了一种新的OmniStage特征融合(OSFF)结构,以有效地融合多层次特征。OSFF包括原始图像叠加初始化(OISI)、浅层特征全局连接(SFGC)和多接收场动态融合(MFDF)。OISI沿着通道维度多次复制和堆叠原始图像,以丰富浅层特征中的细节。SFGC将浅层特征用于以稳定训练过程并利用纹理细节。MFDF将不同阶段的特征与动态感受野模块相结合,以增强和合并不同阶段的特征。此外,我们还通过设计基于IMDB的注意力增强特征提取(AEFD)模块来提高模型性能(,该模块已在之前的超分辨率任务中显示出有效性。我们还集成了蓝图分离卷积(BSConv)(Haase和Amthor 2020)以减少冗余。在此基础上,本文提出了一种面向轻量级图像超分辨率的全阶段特征融合网络(OSFFNet),在基准数据集上的实验结果表明,该网络的性能优于现有的方法,特别是在Urban100数据集上的性能有了显著的提高。

本文的主要工作如下:

  • 提出了一种全阶段的特征融合结构,通过采用原始图像的叠加初始化、浅层特征的全局拼接和多阶段的特征动态融合来增强浅层特征的贡献。这实现了多个特征级别之间的有效互补。

  • 设计了一个注意力增强特征提取模块,并将蓝图分离卷积作为核心构建块。这种组合在保持轻量级计算开销的同时增强了网络性能。

  • 在基准数据集上进行的大量实验证实了所提方法的有效性.结果表明,OSFFNet在轻量级SISR中达到了新的最佳性能,尤其是在Urban100数据集上观察到了显著的改进。

二、相关工作

重建质量

董等人2014最初推出了SRCNN,这是一种用于LR到HR图像映射的三层CNN。SRCNN显示了在SR重建中相对于传统方法的重大改进,激励了随后基于CNN的方法的发展(Lepcha等人。2023)进行进一步改进。

VDSR(Kim、Lee和Lee 2016a)利用堆叠卷积层的残差学习来提高SR精度。EDSR(Lim等人)2017)引入了更深更广的残差网络,以增强特征表示能力。然而,基于剩余学习的方法存在局限性和效率低下的问题。为了解决这些问题,MSRN(Li等人2018)引入了多尺度残差网络自适应检测不同尺度下的图像特征,改进了特征表示。SRDenseNet(童等人)2017)引入了密集连接,以解决梯度消失和特征信息丢失问题,实现了层之间有效的特征传播和重用。

随着网络规模的扩大和深度的加深,各种注意机制的引入已成为深度超分辨率研究的又一趋势。例如,rcan(Zhang et al.2018)使用了通道注意,潘(赵等人2020)采用像素注意力,SAN(Dai等人2019)利用了二阶注意,ENLCN(Xia et al.2022)利用了高效的非本地稀疏注意。此外,自我注意机制在图像重建中表现出了显著的性能。SwinIR (Liang et al. 2021) 利用 Swin Transformer (Liu et al. 2021) 架构、多尺度特征表示、混合注意机制和局部-全局特征交互来实现出色的 SISR。HAT (Chen et al. 2023) 结合通道注意和自注意机制,充分利用通道注意的全局信息诱导能力和自注意的强大表示能力,最终旨在激活更多像素信息。

高效SISR

为了满足边缘设备的需求,开发轻量级、高效的SR模型势在必行(Gendy,He,and Sabor 2023)。许多研究者设计了各种轻量级的SR算法来减少参数个数和计算复杂度。最初,研究人员在SRCNN的上采样前阶段发现了计算冗余,并开始使用上采样后基础设施设计轻量级模型。例如,FSRCNN(Dong、Loy和Tang,2016年)通过在网络末端使用反卷积层将特征图恢复到所需的高分辨率大小,从而打破了计算瓶颈。ESPCN(Shi等人,2016)在像素重建阶段使用亚像素卷积实现了高效的图像超分辨率重建,无需额外的插值,从而实现了快速和高质量的重建。因此,亚像素卷积在轻量级超分辨率中得到了广泛的应用。

LapSRN(Lai等人,2017)利用金字塔结构和跳过连接来利用多尺度图像信息,并通过分层重建逐步提高分辨率。DRCN(Kim、Lee和Lee,2016b)将递归学习引入超分辨率,并通过权重共享策略减少参数计数。卡恩(Ahn,Kang,and Sohn 2018)采用了基于残差学习的级联机制,并使用分组卷积代替标准卷积来减少模型参数的数量。IDN(Hui,Wang,and Gao 2018)采用了一种信息提取策略,通过独立处理当前特征图来更好地利用分层特征。IMDN(Hui et al. 2019)通过更有效的特征提取机制和高效的适应性种植策略提高了模型效率。

最近,研究人员一直在优化卷积方法,以开发更轻、更有效的SR模型。例如,ECBSR(Zhang、Zeng和Zhang,2021)应用RepVGG(Ding等人,2021)的结构重新参数化技术,以有效提取边缘和纹理信息。FMEN(Du et al. 2022)优先考虑内存效率,并利用结构重新参数化来进一步加速网络推理。BSRN(Li等人,2022年)引入了蓝图分离卷积,这是深度可分离卷积的一种变体,结合残差学习以实现高效的超分辨率。

三、提出的方法

整体网络架构全阶段特征融合网络(OSFFNet)的整体网络架构如图2所示。OSFFNet由三个主要阶段组成:初始特征提取、多阶段特征提取和高分辨率重建。这里,ILR表示输入到OSFFNet的原始图像,ISR表示恢复的图像。在高分辨率重建阶段之前,特征图保持与ILR相同的分辨率。我们在初始特征提取阶段对原始图像执行堆栈初始化。具体来说,我们沿着通道维度沿着多次复制和堆叠输入原始图像。然后,我们应用3 × 3蓝图分离卷积(BSConv)来提取浅层特征,从而在浅层特征图中更丰富地表示纹理细节。这个过程可以表示为:

image-20250306161117025

其中$H_{SF}$表示使用3 × 3 BSConv的浅层特征提取(Haase和Amthor 2020)。Concat表示通道级拼接,o表示原始图像的副本数量。接下来,$F_s$使用AEFD和动态感受场(DRF)模块提取多阶段特征。这个过程可以表示为:

image-20250306161204024

image-20250309164613759

Omni-Stage Feature Fusion architecture

Original Image Stacked图像堆叠技术(Lee and Tai 2016)通常用于摄影后处理中的去噪和增强。它通过在没有相机移动的情况下捕获一系列图像来利用噪声的随机性,从而产生略微不同的噪声模式。智能地组合这些图像可以在不牺牲细节的情况下去除噪音。在基于CNN的超分辨率模型中,我们可以通过复制原始图像并随机初始化卷积核来模拟这种噪声随机性。我们设计了一个原始图像叠加的方法(OISI)的基础上,这一现象。如公式1所示,我们将多个原始图像堆叠作为网络的输入,然后使用3 × 3 BSConv来提取浅层特征。这种网络输入的初始化方法允许浅层特征包含更丰富的纹理信息,从而提高模型重建图像的能力。BSRN的研究(Li et al. 2022)已经验证了这种方法的有效性。

浅层特征全局连接:受残差学习(He et al. 2016)的启发,我们引入了浅特征全局连接(SFGC)策略,该策略包括在每个特征提取块的开始处将浅层特征与输入特征相加混合。在每个加法运算之前,将浅层特征乘以可学习的权重参数。这种共享的剩余连接使得能够直接元素级地添加具有不同级别的特征的浅特征,从而促进低频特征和非局部信息的传输。此外,这些剩余连接有效地解决了梯度消失和爆炸问题,导致更快的收敛和更精确的模型训练。虽然SFGC可能会导致轻量级SISR网络的计算和存储开销增加,但这些额外成本是可接受的,不会显著影响性能。

多感受野动态融合:为了整合各个阶段的特征,并充分利用浅层和深层特征的互补优势,我们引入了多感受野动态融合(MultiReceptive Field Dynamic Fusion,MFDF)策略。在这种方法中,如图2所示,MFDF包括多个DRF(与AEFD匹配)。使用具有较小卷积核的DRF来处理较低级别的特征,以更好地恢复图像纹理和结构。相反地,使用具有较大卷积核的DRF来处理较深层特征,以捕获更宽范围的上下文信息并增强图像中的整体结构恢复。

为了进一步增强OSFFNet的特征提取能力,我们设计了一个基于信息蒸馏机制的注意力增强特征蒸馏(AEFD)模块(Hui et al. 2019)。首先,将基于ERB的细化块和基于1 × 1卷积的提取块结合起来进行特征提取。与输入特征相比,提取特征的通道数只有一半。这个过程可以表示为:

$H_{CCA}$表示对比度感知信道注意(CCA)块,其自适应地调整特征图中不同信道的重要性。图3说明了CCA如何通过优先考虑更深维度中的关键特征来增强多层次特征的表达能力。

接下来,我们将增强空间注意力(ESA)(Liu et al. 2020)和CCA(Hui et al. 2019)块线性组合联合收割机以实现注意力增强。ESA的架构如图4所示。在下面的实验中,将视觉注意模块应用于超分辨率任务已被证明是非常有效的。这个过程可以表示为:

四、实验

为了证明所提出的OSFFNet的有效性,我们与一些最先进的(SOTA)轻量级SR方法进行了定量客观比较,其中包括SRCNN(Dong等人,2014),VDSR(Kim,Lee和Lee 2016 a),EDSR(Lim等人,2017),卡恩(Ahn,Kang和Sohn 2018),IMDN(Hui等人,2019)、HNCT(Fang等人,2022)、FMEN(Du等人,2022)、FDIWN(Gao等人,2022)、BSRN(Li等人,2022)和RepRFN(Deng等人,2023)。

定量比较结果如表1所示,其中我们的模型在大多数数据集上实现了最佳指标。图5还显示了在Urban100上对×4 SR的性能和复杂性比较。基于这些比较,我们可以看到OSFFNet在×4尺度下在所有数据集上取得了最佳结果,突出了其对高尺度比率SR任务的上级适应性。此外,我们的模型在所有三个尺度上对Urban100数据集进行了显着改进,这可能是由于OSFF集成了多种策略来增强浅层特征贡献,特别适合城市场景中的重复结构。然而,OSFFNet未能在×2缩减的Set14数据集上实现最佳性能,这表明需要进一步改进局部特征提取。

定性比较: OSFFNet 与其他 SOTA 方法对 ×4 SR 的定性比较如图 6 所示,其中展示了来自 Set14、BSD100、Urban100 和 Manga109 的图像。值得注意的是,与其他方法相比,OSFFNet 在准确恢复 barbara 中的书籍结构信息方面表现出色,并且在 78004 中产生了更清晰的道路纹理。这还证明了img011和Samayoeru中的上级特征表示,从而获得更精细的HR图像。例如,在img011中,只有OSFFNet准确地重建了小区域的纹理,具有令人满意的可视化,与定量结果一致。此外,在Samayoeru中,OSFFNet重建结果中描绘的女性角色显示出更明显的眉毛。

消融实验

OSFF的性能研究:为了研究OSFF中各个模块的不同配置对网络性能的影响,我们实现了OSFFNet的几个变体,每个变体都根据其代码命名。然后,在×4规模下进行实验,并且所有模型都在相同的训练配置下仅训练了1 × 10^5次迭代。训练过程如图7所示,PSNR在Set5上计算。最终结果见表2。值得注意的是,当使用单个模块时,OISI实现了显著的改进。SFGC以最低的成本展示了良好的性能增益,使其成为最具成本效益的选择。我们的网络实现最佳性能时,结合MFDF与其他两个模块。

OSFF 架构的有效性:配置 OSFF 架构后,我们将其应用于 IMDN 以评估其有效性。消融研究的结果如表3所示,表明将OSFF架构集成到IMDN中可显著改善指标,参数数和多添加数仅略有增加。为了确保参数计数和计算复杂度的公平性,我们在通道和深度方面扩展了原始IMDN,并在×4尺度上进行了实验。如表3所示,深度扩展的IMDN优于基于OSF的IMDN,部分原因是其更高的#Params。

注意力机制的评估:我们对OSFFNet的注意力机制进行了消融研究,以分析应用注意力机制前后的性能。通过改变ESA和CCA的存在,我们得到三个变体:Net-w/oAtt,Net-ESA和Net-CCA。在基准数据集上以×4量表评价这些变体,结果总结见表4。值得注意的是,没有注意力机制(#Params)的模型表现出明显的性能下降。单独包括ESA或CCA显示出一些性能改进。此外,当 ESA 和 CCA 结合作为增强注意力机制时,可实现最佳性能,与 Net-w/oAtt 变体相比,Urban100 上的 PSNR 增加了 0.40dB。

high scale下的性能:图8显示了在×6比例下的卓越超分辨率视觉效果。尽管LR图像的分辨率降低到非常小,但我们的OSFFNet表现出了令人印象深刻的超分辨率重建能力。这一成就归功于精心设计的OSFF架构,该架构保护了其底层功能中的关键细节,使OSFF Net即使在严重退化的情况下也能实现出色的性能。

image-20250309164921362

FERMT

FERMT ECCV 2024

目标检测。

提出了DAU+

SeeSR

CVPR 2024

CVPR 2024 真实超分 SeeSR: Towards Semantics-Aware Real-World Image Super-Resolution - 知乎

  • Copyright: Copyright is owned by the author. For commercial reprints, please contact the author for authorization. For non-commercial reprints, please indicate the source.

请我喝杯咖啡吧~

支付宝
微信