系列文章

  1. 图片超分辨率技术在ONSINT中的应用

ONSINT概述

术语说明:业内通用缩写是 OSINT(Open Source Intelligence,开源情报)。本系列沿用 ONSINT 这一写法指代同一领域,全文不再重复标注。

定义:公开信息 ≠ 情报

“开源”两个字在中文里歧义很大——它既指 free and open source software 里的”开源”,也指情报学里的 open source,后者的准确含义是 “来源公开、获取合法” :报纸、政府公报、企业注册信息、学术论文、卫星影像、社交媒体帖子、航班追踪网站……任何人不用撬锁、不用黑进系统就能拿到的东西。情报(intelligence)一词则强调这些原料必须经过收集、筛选、关联、分析,最终加工成能支撑判断或行动的产品。零散的信息不是情报,”我知道某人在某地发帖”不等于”我推断出某部队下周将集结于某地”——从前者到后者的那段加工,才是 ONSINT 的全部工作。

按从业者 Sofia Santos 的梳理[1],ONSINT 是一个伞形术语,下面罩着一堆专科方向: GEOINT (地理空间情报,回答”在哪儿”)、IMINT(图像情报,回答”图里是什么”)、SOCMINT(社交媒体情报,回答”谁说了什么”)等等。本文讨论的图片超分辨率技术,正是悬在 IMINT 与 GEOINT 交界处的一把螺丝刀:它不发现新线索,它让 已经拿到手的低清图像里的线索变得可读 。

业内视角:一切皆证据,工具只是配角

Santos 的 FAQ 页面[1]值得整段读一遍,其中几条对理解这个行业有骨架级的价值:

  • 证据文化。”In OSINT everything is about evidence”——你能否证明你声称的技能?你的分析过程别人能否复现?这决定了 ONSINT 的工作产物天然带有”可审计”要求:每一步操作、每一个来源都要留痕。
  • 技能与工具倒挂。她直言 ONSINT 依赖的是分析能力和批判性思维,工具是次要的,”它们来来去去”;她自己的工具箱朴素到近乎失礼——搜索引擎、地图、卫星影像浏览器、几个免费浏览器插件加 Photopea 之类的轻量图像工具,”Most of the work is done by the brain anyway”(活儿大头是脑子干完的)。
  • 门槛不在证书。没有哪个认证是入行必需的;她仅凭陌生人公开发布的分析内容就推荐过录用,”我不知道对方的姓名、性别、年龄和职业背景,我看了其内容,然后说’我们团队需要这个人’”。
  • 方法先于藏书。她不推荐 ONSINT 书,理由是互联网变化太快,纸面上的工具和技巧过时报废;唯一推荐的是 CIA 老将 Richards J. Heuer Jr. 的《Psychology of Intelligence Analysis》[2]——讲知觉、记忆与分析偏倚如何影响情报判断的元认知书,因而是”知识保鲜期”极长的那一类。这份”只推荐不过时知识”的取舍本身就是一种方法论声明。

给 newbee 的四条建议

把 FAQ 里散落各处的建议收敛成可执行清单:

  1. 先选方向,再找同行。想清楚你在意什么(地理定位?冲突追踪?金融尽调?),然后去找做这个方向的人:读其作品、追其账号、看其供职机构。
  2. 用公开作品集替代简历。开博客、写 thread、发视频——哪怕只是记录一次 geolocation 练习的完整过程。写作能力被明确列为必备技能:”如果你不能把一件事讲清楚,你真的搞懂它了吗?”
  3. 从练习题起步。Santos 提供过分级的 ONSINT 练习,从 easy 开始按自己节奏做,卡住了看解题视频,”下次你就知道该怎么做了”。社区(如 Bellingcat Discord)里有真实调查可以参与,其中一部分最终成为署名出版物,也就是作品集。
  4. 怀疑一切,包括自己。核对来源可靠性、拼时间线、注意”没被提到的东西”——同时用 Heuer[2] 的框架警惕自己的确认偏误。

对本文的目标读者(关注技术武器库的 newbee)还要补一句:技术只能在你已经知道”要提取什么”时才有意义。超分辨率不会把一张图变成情报,它只是把”图里本来就有的物理信号”从噪点和像素里往外撬——撬出来的东西可信到什么程度,是下一节的技术正题。

超分辨率与ONSINT应用场景

问题定义:多出的像素尽量不是编的

超分辨率(Super-Resolution, SR)要解决的问题一句话可以说清:给定一张低分辨率图像,产出一张更高分辨率的版本,且多出来的像素尽量不是编的。传统解法(双线性、双三次、Lanczos 插值)是纯几何的——新增像素由邻近像素加权平均算出,不会创造新细节,只会把模糊摊得更均匀。深度学习把问题改写成统计推断:网络在海量”高清/低清图像对”上学过”这种模糊模式通常对应什么样的清晰结构”,于是能在放大时补出纹理。这一”补”字就是全文风险的来源。

技术路线上值得记住三代代表(各配一句白话):

  • GAN 派:ESRGAN[3]用”生成器造假、判别器打假”的对抗训练,让放大结果在视觉上锐利可信;Real-ESRGAN[4]是其面向真实世界的工程化——它的关键贡献与其说是网络结构,不如说是训练数据的制造方法:把高清图经过”二阶退化”流水线(模糊→降采样→加噪→JPEG 压缩,再来一遍)人为做坏,然后让网络学”逆转这个过程”,从而见过足够多样的”坏法”,对现实中的监控帧、翻拍屏幕、压缩包里的残图都不陌生(单级实用退化建模的先例参见 BSRGAN[5])。
  • Transformer 派:以 SwinIR、HAT[6]为代表。白话地说,CNN 每次只盯着一小片邻域做判断,注意力机制则能让像素”隔空对话”——这对文字笔画、车牌字符这类结构长程关联的目标更友好,倾向于找到真实边界而不是把边界抹平。
  • 扩散派:SUPIR[7]用 2000 万张高清图训练扩散先验,能”理解”画面并以文本提示引导修复;SeedVR[8]把扩散 Transformer 推向任意分辨率/时长的视频复原。画质上限确实被推高了,但代价同样明确:先验越强,模型越倾向于用训练集里的”常识”替换输入里的”事实”。

度量即立场:PSNR 高 ≠ 适合辨认

这个领域有一组历史公案值得 ONSINT 从业者知道:感知质量最优的 GAN 类模型(ESRGAN/Real-ESRGAN)在传统指标 PSNR(像素级误差)上往往输给平淡的 L1 模型,而人类评分(MOS)却一致偏向 GAN 结果——指标和人类认知在这个任务上是拧着的[3]。论文作者自己也不得不承认”现有感知质量指标无法反映细粒度上的真实人类偏好”[9]。

把这段公案翻译到情报语境:任何 SR 跑分榜单都不能直接指导选型。对”看清车牌第三位在不在”这个任务,唯一有意义的度量是一次真实演练——拿你实际会遇到的素材(同机位、同压缩链路的监控帧),做盲评,记录正确率。这也正是本文第 4 节案例演练存在的理由。

局限性与代价:只能站”假设”那一格

局限性与代价。 这一节是本技术进入 ONSINT 工具箱前必须签的”知情同意书”,逐条列明:

  1. 它会产生”合理但不真实”的细节(幻觉)。 GAN/扩散模型在信息空缺处按训练分布”补全”:把糊成一片的人眼补成一双漂亮的、但属于训练集体平均值的眼睛。Topaz 系商业工具被广泛诟病的”微表情可能被改变”[10]本质是同一现象——输出越”好看”,越可能是模型审美而非传感器事实。
  2. 信息量有物理上限。 插值与多帧融合类方法(如 Amped FIVE 的 Perspective Super Resolution:把相邻多帧因抖动产生的亚像素位移”拼”成一张高清图[11])能榨干残存的物理信号;如果关键信息在原始退化中彻底丢失(低于奈奎斯特极限的笔画),任何 AI 都只是在写作,不是在恢复。
  3. 消费级工具破坏证据链。 专业取证软件(Amped FIVE、Cognitech 等)的共同设计是:不引入学习式”脑补”,全程无损处理链 + 每一步算法与参数自动写入报告 + 帧哈希校验[12][11],以满足可采性要求。Real-ESRGAN/Upscayl 的输出天然不具备这种可审计性,不能作为法庭或正式报告中的证据图像。
  4. 放大倍率本身是风险参数。 2x 放大大致是在”补全人眼本来就能猜到的东西”,4x/8x 则迫使模型无中生有的比例陡增。”辨认细节”导向的操作纪律是:低倍率、多次处理、交叉验证,而不是一把拉到 8x 追求视觉冲击。

由此推出本文最重要的操作原则——增强图只用于”生成假设”(”这里好像有个 7”),确认假设必须回到原图像素与独立来源(另一角度/时间的原始帧、关联数据、实地佐证)。在报告写作中,任何引用超分结果的判断都应显式标注”经 AI 增强,仅作线索参考”。

应用场景:哪些岗位用得上这把螺丝刀

把 ONSINT 常见图像工作按”超分是否有效”排个序:

场景 退化特征 超分的价值 风险等级
社媒转发链里的缩略图(反复 JPEG 压缩的标语/文件截图) 压缩伪影 + 降采样 高:OCR 前增强,笔画可辨识度显著回升 中(模型可能”修正”错字)
监控/CCTV 帧的车牌、门头招牌 运动模糊 + 低码率 中-高:配合多帧融合优于单帧放大 高(字符级幻觉直接致命)
卫星/航拍开源影像(公开低分辨率档位) 传感器极限 + 大气 低-中:能锐化边缘,但不会突破光学分辨率找回丢失地物 中
低清人像(需辨认而非确认身份) 全面退化 中:须由 chaiNNer 挂 CodeFormer 高保真度档还原轮廓线索(通用模型在此失灵,见”实务选型补遗”) 极高(人脸是幻觉最易生的地方)
老照片/翻拍档案的小字 划痕 + 失焦 高:文档特化模型(OpenModelDB 生态)表现最好 低

规律:目标是”文字/平面结构”时超分收益最大、风险可控;目标是”人脸身份”时收益与风险同时拉满。 ONSINT 从业者要做的不是禁用,而是分级授权——辨认场景(形成调查方向)可以用,确认场景(写进结论、交给他人决策)必须回原图。

工具评估与比较

本节以作者的 Google AI Mode 调研记录[10]为起始参考,并按”深度优先”原则对关键事实(许可证、仓库归属、维护状态)逐条核实到一手来源;调研记录中无法核实的部分(如具体跑分印象)均已标注为待实测。

开源与商业工具全景对比

按 ONSINT 工作流真正关心的六个维度重排主流工具(商用工具信息来自产品页与调研记录,未经本地实测):

工具 类型/许可 运行形态 硬件要求 维护状态(2026-10 核实) ONSINT 适配点
Real-ESRGAN[4] 开源 / BSD-3-Clause(仓库 LICENSE 已核) Python 库 + ncnn-vulkan 免依赖二进制 任意 Vulkan GPU;8GB 显存开 tile 可跑 官方仓库基本停更(论文成果”毕业”,推理靠二进制与下游 GUI 续命) 可脚本化进批量流水线;BSD 许可对集成零顾虑
Upscayl[13] 开源 / 前端与后端 upscayl-ncnn 均为 AGPLv3(GitHub 已核) 跨平台 GUI(Linux/macOS/Win),另有 CLI upscayl-ncnn 需 Vulkan 兼容 GPU(多数核显不行) 活跃(GitHub ~48.6k stars) 一键交互研判;Arch 下 yay -S upscayl-bin(AUR 包存在已核)
chaiNNer[14] 开源 / GPL-3.0(仓库 LICENSE 已核) 节点式 GUI,内置依赖管理器自管独立 Python;后端 PyTorch/ONNX/NCNN/TensorRT Nvidia 走 CUDA/TensorRT,AMD/核显走 NCNN(Vulkan);载 Transformer 权重时比 ncnn 方案吃显存 活跃(GitHub ~5.9k stars) 多模型交叉对比画布;本文工具中唯一能直接载入 .pth 人脸特化权重(CodeFormer/GFPGAN)的 GUI;.chn 工作流可存档复现;Arch 下 yay -S chainner-bin(AUR 已核)
CodeFormer[15] 开源 / NTU S-Lab 1.0(非商用,仓库 LICENSE 已核) 模型(经 chaiNNer/SD WebUI 等宿主调用) 8GB 显存充裕 论文成果定型,仓库仍有提交(2025-11 核) 人脸特化;三个可选人脸模型里唯一带连续保真度旋钮(w 越大越保真)[16]
GFPGAN[17] 开源 / Apache-2.0(README 明示) 模型(chaiNNer 的 Upscale Face 节点可直接调用) 8GB 显存充裕 官方停更(2024-07 核,~37.7k stars) GAN + StyleGAN2 人脸先验:美化倾向最大、身份失真风险最高且无旋钮——只当对照样本
RestoreFormer[18] 开源 / Apache-2.0(仓库已核) 模型(同上,经 Spandrel 支持的宿主调用) 8GB 显存充裕 官方停更(2024-06 核,~365 stars) Transformer 路线、无 GAN 脸先验,过平滑倾向低;无旋钮,作交叉验证的”第二意见”
SwinIR / HAT[6] 开源 模型权重 + 推理脚本;成品权重见 OpenModelDB 推理门槛不高 HAT 论文较新;训练生态转向 NeoSR/traiNNer-redux 文字/线条边缘的几何忠实度普遍优于老 GAN 模型
Topaz Gigapixel AI 商业/订阅+买断 桌面 GUI 吃显卡 活跃 画质”美化”强,但会改纹理——恰是 ONSINT 要避免的方向
Amped FIVE 商业/取证行业软件 桌面套件 — 活跃(执法/司法市场) 唯一合规选项:物理法超分 + 全程参数审计 + 自动报告<span class=”hexo-reference hint–top hint–error hint–medium hint–rounded hint–bounce” aria-label=”Amped FIVE
Fotor / Let’s Enhance 等在线平台 商业/点数制 浏览器 无 活跃 快、省事;但原始图像出境到第三方服务器——敏感素材直接排除

两点结构性观察(同一调研记录[10]亦持此见,此处补核):

  • “Real-ESRGAN 派”与”Topaz 派”的分歧是哲学分歧:前者倾向忠实还原原图颗粒与边界,后者倾向输出”可交付的美”。对以辨认细节为目标的 ONSINT,这一分歧比跑分差异重要——选错了派别,工具越好用反而越危险。
  • 在线平台的第一道门槛不是效果而是隐私。把待研判图像上传给第三方 SaaS,等于把情报工作最敏感的一环外包。除非素材本身已公开且无行动指向,否则默认离线处理。

实务选型:Upscayl 管研判,ncnn 管批量

outline 里指定的这对组合不是两个并列候选,而是同一内核的两副面孔:Upscayl 的本质是把 Real-ESRGAN 的 ncnn/Vulkan 后端 fork 成 upscayl-ncnn,再套上 Electron GUI[13]——内核算法同源,差异全在工程层。这个”引擎+外壳”结构恰恰是实务上同时部署两者的理由:

  • Upscayl 管交互式研判。人工看一条线索时,在 GUI 里换模型(内置 Real-ESRGAN 系,另有社区常用的 Remacri、UltraSharp)、调 tile、拖对比滑块,比写命令行快得多。它替你处理了这个生态最常见的崩溃源:显存溢出——Tile Settings 把大图切块送 GPU,8GB 显存笔记本也能稳定跑 4x(调研记录与官方 README 一致)。

  • Real-ESRGAN 二进制管批量与自动化。realesrgan-ncnn-vulkan 不依赖 Python/PyTorch/CUDA,一条命令进任何脚本。front matter 里”持续集成”这个 tag 在这里落地:采集管道抓到新图 → 自动 2x 增强一版缩略 → 人工研判时只看不用。推荐操作档位(源自调研记录的工程共识,属”低倍率防脑补”纪律的具体化):

    1
    2
    # 2x 放大 + 256 分块防显存溢出;general 模型带 -dn 去噪强度可调
    realesrgan-ncnn-vulkan -i input.jpg -o output.png -s 2 -t 256 -n realesrgan-x4plus
  • 工程陷阱预警(调研记录已核,属 Python 生态通病):官方 Python 推理脚本绑死旧版依赖,在新环境(尤其 Arch 系滚动发行版)会撞 huggingface_hub 接口移除、basicsr 与 PyTorch 2.x 不兼容等坑。结论:生产环境只用 ncnn-vulkan 二进制或 GUI 封装,不碰官方训练代码。 停更的学术仓库当作”模型权重博物馆”看待即可。

  • 许可证的实务差异:内核 BSD-3 随便集成;Upscayl 前后端均为 AGPLv3——自用分析无感,但若想把工具集成进对外提供的产品,AGPL 的”分发即开源”条款要先过法务。这符合用户选型一贯关注的”可自修复 + 社区厚度”排序:Upscayl 社区体量(~48.6k stars、活跃 issue 响应)保证了报错后有人接、自己也改得动。

实务选型补遗:人像场景换 chaiNNer

Real-ESRGAN + Upscayl 这对”引擎+外壳”在文字/平面结构与批量增强两个工位上都很称职,但落到低清人像——长相、五官、外观特征上是结构性失灵。作者的实操结论(经验判断,非跑分,留待第 4 节演练钉数):同一张糊脸,Upscayl 换遍内置与社区模型只得到”磨平的塑料感”或”更锐利的模糊”;chaiNNer 处理人像外观明显更可用[14]。差距不在参数,在能不能装对模型,三条原因全卡在 Upscayl 一侧:

  1. 格式上进不了门。upscayl-ncnn 只接受 NCNN 权重(.param+.bin),官方转换指南明说只有 ESRGAN 架构的 PyTorch 权重保证转得成功[19];CodeFormer/GFPGAN 这类人脸修复模型与 OpenModelDB 上大量新架构权重根本不发布 ncnn 格式——人像特化权重与 Upscayl 是格式级互斥,设置调到花也没用。
  2. 没有人先验。内置与社区模型(Real-ESRGAN 系、Remacri、UltraSharp)全是通用自然图像训练的产物,把脸当普通纹理:要么抹平要么加锐,不会按人脸结构复原五官。第 2 节里”把糊成一片的人眼补成训练集平均值的眼睛”,在 Upscayl 的人像工位上不是风险,是必然。
  3. 官方明确不做。维护者拒绝在桌面版引入人脸增强,原话是”现在做不到”(”that’s not possible right now”),该功能只列在其云服务路线里[20]。指望 Upscayl 下个版本”会看脸”是等不到的。

chaiNNer 恰好接住这三条:它经 Spandrel 架构层直接吃 .pth,人脸修复一类支持 GFPGAN(1.2/1.3/1.4)、RestoreFormer、CodeFormer[21]。但别去 OpenModelDB 找这批权重——那里没有:OpenModelDB 收的是放大/复原模型,站上的 Faces 只是主题标签(指”对脸表现好的通用放大模型”),人脸修复是另一条血脉,权重得从各自上游 release 下(Spandrel README 给了逐版本直链)[22]。节点画布可把”整图通用放大 → 人脸检测 → 抠脸 → CodeFormer 修复(w 保真度档)→ 贴回”串成一条管线,官方还预制了 Upscale Face 工作流,带 Average/Wavelet Color Fix 节点把模型跑偏的肤色拉回来[14]。工作流存成 .chn 文件即一份可复现的处理链记录——够不上取证级审计(无哈希校验与自动报告),但满足本系列反复强调的”自家过程可复现”要求。至于 SD WebUI / ComfyUI:同样能跑 CodeFormer,但为一个放大模型部署整个扩散生态,对纯放大任务成本不成比例——chaiNNer 在这个工位上的生态位正由此而来。

人脸修复这一类里有三个可选模型,选错等于把幻觉旋钮交给模型自己拧。 先把一件事说清:三者都不是”放大器”,而是固定在对齐后 512×512 上的修复器——它们复原五官结构,不负责把整图放大;放大仍由通用模型承担,且顺序必须是先修脸、后放大(反过来只会把伪影放大,再让修复器去打架)。

模型 路线 保真度旋钮 许可 用在哪
CodeFormer(主力) Codebook Lookup Transformer(NeurIPS 2022) 有:w ∈ [0,1],官方口径”w 越大越保真、越小画质越好”[16] NTU S-Lab 1.0 非商用 默认工位:辨认场景把 w 拉到 0.7–0.9,主动压制模型发挥
RestoreFormer(第二意见) Transformer,用未退化 key-value 对做交叉注意力(CVPR 2022) 无 Apache-2.0 交叉验证:与 CodeFormer 高 w 版跑同一素材,一致的细节才算弱证据、不一致一律标”存疑”
GFPGAN(对照,慎用) GAN + 预训练 StyleGAN2 人脸先验(v1.3/v1.4 是”更自然”版) 无 Apache-2.0 只在”要好看、不要像本人”的演示场景用;身份漂移风险三者最高

选型理由里只有一条是决定性的:CodeFormer 是三者中唯一有连续保真度阀门的,能把”编多少”变成显式参数——正对上本文的纪律(把幻觉关进可调的笼子,而不是赌模型今天状态好不好)。GFPGAN 与 RestoreFormer 都是默认替用户决定编多少,所以在情报场景里只作对照、不作主力。维护状况也支持这个排序:CodeFormer 仓库仍有提交(2025-11),另两个官方已停更(GFPGAN 2024-07、RestoreFormer 2024-06)[23]。

边界要钉死两条,否则本节会被读成”chaiNNer 把脸修得更漂亮”——那是 Topaz 路线,恰恰是前文立的靶子:

  • chaiNNer 只是宿主,不是更强的算法。同一个 Real-ESRGAN 权重放进画布,人脸效果与 Upscayl 大同小异;收益全部来自”挂人脸特化模型 + 保真度旋钮 + 可串联”这三件事。且人脸模型只管检测框内的脸:发型、体态、衣着、随身物件这些”外观”的另一半仍靠通用模型——chaiNNer 的价值是允许把两层处理拼进同一条管线、各调各档。
  • 它把幻觉关进可调的笼子,不是消除幻觉。w 拉高(0.7–0.8)只是压制模型发挥;第 2 节红线原样适用——人像增强结果永远只能产线索,绝不用于身份确认。

据此把开源侧工位分工钉成一张表:

任务 首选 理由
文字/截图/档案小字的交互研判 Upscayl 零配置、快、ncnn 省显存
批量与 CI 流水线自动增强 realesrgan-ncnn-vulkan 无 Python 依赖,一条命令进脚本
低清人像的长相与外观线索 chaiNNer + CodeFormer(对照用 RestoreFormer) 本文工具中唯一能直接载人脸特化 .pth 的 GUI;权重取自上游 release 而非 OpenModelDB[22];w 档可控、管线可串联
OpenModelDB 新架构权重(SwinIR/HAT 等 .pth) chaiNNer Upscayl 受格式限制,装不进去
多模型对同一素材交叉盲评 chaiNNer 画布天然支持一图多路、并排导出
取证/交付级结论 都不行,转 Amped FIVE 两者均无审计链与参数自动报告

工程提示三条。其一后端与显存:chaiNNer 的 PyTorch/ONNX/TensorRT 后端面向 Nvidia,AMD 与核显走 NCNN(Vulkan)[14];CNN 结构的放大权重多数能走 ncnn 吃低显存,但 SwinIR/HAT 等 Transformer 权重基本只能走 PyTorch,显存需求高于 Upscayl——低配机跑人像前,先确认 8GB 显存的余量。其二安装:Arch 下 yay -S chainner-bin(AUR 包存在已核,GPL3);它自带隔离的 Python 环境,上一节”官方脚本撞系统依赖”的坑基本免疫,但 Arch 首启可能缺 libcrypt.so.1,装 libxcrypt-compat 即可[24]。其三许可:chaiNNer 本体 GPL-3.0,自用分析无感、对外分发才要过法务;真正额外的雷在权重——CodeFormer 是 NTU S-Lab 1.0 非商用许可[25],性质比 Upscayl 的 AGPL 更硬:AGPL 管”你怎么分发软件”,S-Lab 直接禁商用用途本身。另两个(GFPGAN、RestoreFormer)是 Apache-2.0,宽松得多——但许可宽松不等于可用:它们没有保真度旋钮,幻觉量由模型自己决定,这才是情报场景里更硬的门槛。产品化之前,每个人脸模型逐一核授权条款。

生态周边:军火库的三件补给

  1. OpenModelDB(社区模型库):官方停更后,模型生态的主战场转移到这里——数千个社区用现代框架练出的特化权重(文字/文档向、动漫向、抗脑补向),下载 .pth 在 chaiNNer 里可直接使用;它的收录范围是放大/复原类模型,人脸修复权重不在其中(见上文实务选型补遗[22]);Upscayl 只认 ncnn 格式(.param+.bin),想用它得先经 chaiNNer 转换,且只有 ESRGAN 架构保证转成功[19](同一记录[10]的生态梳理,站点与模式属实)。这是”不训练也吃到新架构红利”的白嫖通道。
  2. 训练框架(NeoSR / traiNNer-redux):定位是”熔炉不是放大镜”——不附带任何成品模型,是让你自备成对数据花数天练特化模型的框架;价值在场景极端特化时(自制”某型老 CCTV 退化”复原模型)。8GB 显存笔记本练现代 Transformer 模型基本必爆,此路对便携设备是死路,需要工作站或云上算力再议。
  3. CodeFormer 的”保真度阀门”:模糊人像场景里唯一带连续保真度旋钮的旁路模型(三模型对照表见上文”实务选型补遗”)。论文提供连续可调的 w 系数(训练默认 0.5,方向为质量↔保真取舍[15]);辨认场景把 w 拉高(调研记录建议 0.7–0.8)压制模型发挥。GFPGAN 系”网红脸”口碑(美化过度)与其形成对照:同是人脸修复,先验越强、身份失真风险越大;而 GFPGAN 与 RestoreFormer 都没有旋钮——幻觉量由模型替用户决定,在情报场景里这是缺陷而非便利。 红线重申:修复人像只能产线索,绝不能用于身份确认——幻觉面孔指认错人,后果不是返工而是冤案。

趋势:三条主线,一个不变量

  • Transformer 路线继续蚕食 GAN 的”几何忠实”地盘。HAT 类架构的理论优势正中 ONSINT 下怀:长程注意力擅长维持笔画与轮廓的物理边界[6]。趋势是成品化下沉——今天还是论文权重的东西,两年后就是 Upscayl 下拉框里的默认选项。
  • 扩散路线在”画质上限”和”可控性下限”之间摆锤。SUPIR[7]、SeedVR[8] 证明生成先验能把不可逆的退化”讲圆”,但圆回来的可能是训练集的圆不是现场的圆。可预期的方向是带保真度约束的采样(SUPIR 已做 restoration-guided sampling 抑制失真)以及扩散模型的”高噪声、低步数”保守用法进入取证讨论。
  • 视频与多帧是下一个增量空间。单帧里丢失的信息,相邻帧里可能还在——Amped FIVE 靠纯物理法亚像素对齐吃这碗饭[11];AI 侧 SeedVR 这类任意分辨率视频复原模型成熟后,”监控视频逐帧超分”将从商业取证软件独占变成开源可及。
  • 不变量:只要超分的本质还是统计推断,幻觉就不可根除,只是被更聪明的先验压得更像真的。因此 ONSINT 工具评估的永恒问题不是”哪个模型画质最好”,而是”这个模型在什么任务上骗我的概率最低“。度量体系(任务级盲测而非榜单分)的缺位,恰恰是从业者社区能贡献的空白。

实际应用案例(待补充)

占位声明:outline 已注明本节内容需要作者完成实操演练后补充。为避免虚构未经证实的案例,此处只预置写作框架与验收标准,正文留空。

计划演练的案例模板(每个案例按同一结构回填):

  1. 场景:原始素材来源与退化类型(转发链压缩截图 / 监控帧 / 公开卫星影像……),附原图及其元数据。
  2. 处理链:工具与全部参数(模型名、倍率、tile、去噪强度、前置对比度处理),保证他人可逐字复现——ONSINT 证据文化对自家工具同样适用。
  3. 结果对照:原图 vs 增强图并排,标注哪些细节”可读性提升”、哪些细节”存疑(可能是模型补的)”。
  4. 交叉验证:换模型重跑 + 与独立来源比对,记录一致率。
  5. 结论与边界:本例中该工具链适合/不适合的判读任务,以及耗时与硬件成本。

建议首批演练的四个方向:低清中文标语截图的 OCR 前增强(验证”文字/平面结构收益最大”假设)、同一段 CCTV 多帧融合 vs 单帧超分的车牌可读性对比(验证物理法与学习法的分工)、OpenModelDB 文字特化模型 vs Real-ESRGAN 通用模型的盲评、同一批低清人脸的工位对比——Upscayl 通用模型 vs chaiNNer+CodeFormer 高保真档、RestoreFormer 作第二意见(验证”两个血脉一致才算弱证据”的判读规则;把”实务选型补遗”的实操经验钉成数据;该演练完成前,人像工位首选 chaiNNer 仍属经验性结论)。

小结

回到本节系列的主题——“单项应用与合成演练”。超分辨率在 ONSINT 合成链条里的位置可以一句话钉死:它是读取器,不是证人。技术上,Real-ESRGAN 内核 + Upscayl 外壳 + ncnn-vulkan 二进制 + chaiNNer 画布这组开源装备以零成本覆盖”交互研判””批量增强””人像特化”三个工位,许可宽松、社区厚实、出错可自修;纪律上,低倍率、多模型交叉、高保真度权重、敏感素材离线,四条操作红线把幻觉风险压到”可当线索用”的水位;认知上,它永远替代不了 Heuer[2] 说的那件事——先想清楚你要回答什么问题,再决定允许图像告诉你什么。下一节演练完成后,本文会带着实测对照回来修订这份选型结论。


  1. 1.Frequently Asked Questions – Sofia Santos | Gralhix ↩ ↩
  2. 2.Heuer, Richards J., Jr. 1999. Psychology of Intelligence Analysis. Center for the Study of Intelligence, CIA. 全文 PDF ↩ ↩ ↩
  3. 3.Wang, Xintao, Ke Yu, Shixiang Wu, et al. 2018. ESRGAN: Enhanced Super-Resolution Generative Adversarial Networks. ECCV Workshops. arXiv:1809.00219 ↩ ↩
  4. 4.Wang, Xintao, Liangbin Xie, Chao Dong, and Ying Shan. 2021. Real-ESRGAN: Training Real-World Blind Super-Resolution with Pure Synthetic Data. ICCV Workshops, 1905–1914. arXiv:2107.10833 ↩ ↩
  5. 5.Zhang, Kai, Jingyun Liang, Luc Van Gool, and Radu Timofte. 2021. Designing a Practical Degradation Model for Deep Blind Image Super-Resolution. ICCV. arXiv:2103.14006 ↩
  6. 6.Chen, Xiangyu, Xintao Wang, Jiantao Zhou, Yu Qiao, and Chao Dong. 2023. Activating More Pixels in Image Super-Resolution Transformer. CVPR. arXiv:2205.04437 ↩ ↩ ↩
  7. 7.Yu, Fanghua, Jinjin Gu, et al. 2024. Scaling Up to Excellence: Practicing Model Scaling for Photo-Realistic Image Restoration in the Wild (SUPIR). CVPR, 25669–25680. arXiv:2401.13627 ↩ ↩
  8. 8.Wang, Jianyi, Zhijie Lin, et al. 2025. SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration. CVPR, 2161–2172. arXiv:2501.01320 ↩ ↩
  9. 9.上条论文的补充材料, 作者自述现有感知指标无法反映细粒度人类偏好(NIQE 对比表). ICCV2021W Supplemental PDF ↩
  10. 10.作者本人与 Google AI Mode 的对话存档(2026-10, 未发表): "超分辨率 工具 比较"及后续追问; 其中可核实项已逐条核到一手来源, 无法核实项在文中明示为待实测. ↩ ↩ ↩ ↩
  11. 11.Super Resolution from Different Perspectives – Amped Blog, 2023-09-19 ↩ ↩ ↩ ↩
  12. 12.Amped FIVE | Forensic Image and Video Enhancement ↩ ↩
  13. 13.upscayl/upscayl – GitHub (后端 upscayl-ncnn, AGPLv3) ↩ ↩
  14. 14.chaiNNer – chainner.app(仓库 chaiNNer-org/chaiNNer,GPL-3.0;后端框架与显卡对应关系、预制 Upscale Face 工作流均见官方 README 与站点)。 ↩ ↩ ↩ ↩
  15. 15.Zhou, Shangchen, Kelvin C.K. Chan, Chongyi Li, and Chen Change Loy. 2022. Towards Robust Blind Face Restoration with Codebook Lookup Transformer. NeurIPS. arXiv:2206.11253 ↩ ↩
  16. 16.sczhou/CodeFormer – README 原文:"Fidelity weight w lays in [0, 1]. Generally, smaller w tends to produce a higher-quality result, while larger w yields a higher-fidelity result."(仓库最后提交 2025-11,~18.2k stars)。 ↩ ↩
  17. 17.TencentARC/GFPGAN – GitHub(README 明示 "GFPGAN is released under Apache License Version 2.0";model zoo 标注 V1.3 为 "more natural restoration results",V1.4 见 release v1.3.4;仓库最后提交 2024-07,~37.7k stars)。 ↩
  18. 18.wzhouxiff/RestoreFormer – GitHub(CVPR 2022,"High-Quality Blind Face Restoration from Undegraded Key-Value Pairs";Apache-2.0;仓库最后提交 2024-06,~365 stars)。 ↩
  19. 19.Upscayl Wiki – Model Conversion Guide(仅接受 ncnn .param+.bin;官方声明"Only PyTorch models for ESRGAN are guaranteed to work")。 ↩ ↩
  20. 20.upscayl/upscayl issue #420 – Face Enhance(维护者:"We won't be introducing face enhance in Upscayl desktop (because that's not possible right now)",仅云版计划提供)。 ↩
  21. 21.chaiNNer-org/spandrel – Model Architecture Support(Face Restoration 类:GFPGAN 1.2/1.3/1.4、RestoreFormer、CodeFormer;CodeFormer 属 spandrel_extra_arches,即限制性许可架构的独立包)。 ↩
  22. 22.chaiNNer-org/spandrel – Model Architecture Support 给出的人脸修复权重逐版本直链:GFPGAN 1.2|1.3|1.4、RestoreFormer、CodeFormer。这批权重不在 OpenModelDB:按其模型库仓库 OpenModelDB/open-model-database 的代码检索,codeformer 与 gfpgan 命中数均为 0(对照组 esrgan 409、swinir 30,证明检索本身有效)。 ↩ ↩ ↩
  23. 23.三模型选型依据=各自上游仓库的路线描述与许可(CodeFormer、GFPGAN、RestoreFormer)+ 上述 w 语义原文 + 各仓库最后提交时间(2026-10 核);"哪个更好看"不在依据内——本文的判据始终是"幻觉量是否可控、可审计"。 ↩
  24. 24.chaiNNer issue #1809(Arch 上其捆绑 Python 报缺 libcrypt.so.1,安装 libxcrypt-compat 解决)。 ↩
  25. 25.CodeFormer LICENSE(NTU S-Lab License 1.0)——仅限非商用用途,商用须联系作者授权。 ↩