仕組み
AIアップスケーラーで良い結果を得るには
アップスケーリングは単なるリサイズではありません。モデルに何が再構成できて何ができないかを知っておくことが、くっきりした拡大とのっぺりした拡大を分けます。
従来の拡大 — バイキュービック、Lanczos、画像編集ソフトに内蔵されたリサンプリング — は、すでにある画素の平均を取って動きます。幅を4倍にせよと言われれば、出力の4分の3を算術だけで作り出すほかありません。眠い仕上がりになるのはそのためで、数学的に妥当な「元画像のぼかし」でしかないのです。
超解像モデルは違う働き方をします。同じ画像の小さい版と大きい版を組にした数百万のペアで学習しているため、縮小されたまつげ、レンガの角、文字の骨格が原寸ではどう見えていたかを覚えています。平均を取る代わりに、失われた可能性が最も高いディテールを予測するのです。単純なリサンプリングでは決して生まれない、肌の質感や布の織り目が拡大写真に現れるのはこのためです。
ここで効いている言葉はもっともらしいです。モデルは学習内容と整合するディテールを再構成するのであって、実際にそこにあったディテールを復元するわけではありません。写真、イラスト、スクリーンショットであれば、ほぼ常にそれが望ましい結果です。しかし正確さそのものが目的の対象 — ナンバープレート、医用画像、証拠として扱うつもりの文書 — では、拡大画像はあくまで解釈であり、取り戻された事実として読んではいけません。
アップスケールできるファイル
Veedz AIは4つの入力形式に対応し、元ファイルは20MBまでとしています。この上限があるのは、すべてがブラウザのタブ内で動くからです。画像全体を、モデルと出力バッファと並べてメモリに収める必要があります。
| 形式 | 向いている用途 | 注意点 |
|---|---|---|
| PNG | スクリーンショット、UI、ロゴ、線画 — べた塗りと硬いエッジ | ファイルが大きく、JPEGより早く20MBの上限に達します |
| JPEG | カメラやスマートフォンの写真 | 既存の圧縮ノイズも一緒に拡大されます — 下の「元画像」の項を参照 |
| WebP | 現代のウェブから保存した画像 | 非可逆WebPにはJPEGと同じ注意が当てはまります |
| AVIF | 新しく効率の良いウェブ画像 | 古いマシンでは他形式よりデコードが遅くなります |
手元にある最良の元画像から始める
画質に効く最大の要因であり、しかも費用はかかりません。モデルは与えられたものを欠点ごと増幅します。スクリーンショットを撮られ、保存し直され、メッセージアプリを3回通った写真には、圧縮ブロック、色のバンディング、なまったエッジが乗っており、アップスケーリングはそのひとつひとつを忠実に拡大します。
拡大する前に、もっと良い版がないか確かめてください。チャットから落としたコピーではなくカメラロールの原本、そのJPEGスクリーンショットではなく書き出したPNG、サムネイルではなくフルサイズのファイル。900ピクセルの原本を4倍にした結果は、400ピクセルの原本を4倍にした結果を、画素数の差から想像する以上に大きく上回ります。
2倍か4倍か
どちらの倍率も同じモデルを使い、4倍はより多くの再構成を求めるだけです。反射的に最大値を選ぶのではなく、実際に必要なサイズに合うほうを選んでください。
- 2倍 — 写真、人物の顔、すでにそれなりに鮮明な画像には安全な選択。ディテールが原画に近いまま保たれ、作り出された質感も目立ちにくくなります。
- 4倍 — 本当に小さい素材向き。古いアイコン、サムネイル、低解像度のスキャン、ドット絵、印刷や投影に耐える必要があるロゴなど。
仕上がりサイズが決まっている場合は、そのすぐ上の倍率で拡大してから任意の編集ソフトで縮小してください。4倍の結果を目標サイズへ縮小する処理はほぼ無劣化で、わずかに小さすぎる2倍の結果を受け入れるより見栄えが良くなるのが普通です。
出力形式を選ぶ
出力セレクターは形式と倍率をひとつのメニューにまとめています。既定はPNGの4倍です。
- PNG(可逆) — モデルが出力したものをそのまま保持します。再編集、印刷、保管の予定があるならこれが正解。ファイルは大きくなり、4倍のPNGは元の数倍になることもあります。
- WebP(軽量) — 見た目はPNGとほぼ同じで、容量はごく一部。ウェブサイトや文書に載せるものには最適な既定値です。
- JPEG — 最も互換性が高く最も軽い一方、再構成の上から非可逆圧縮をかけ直します。共有には妥当ですが、繰り返し編集・再保存するファイルには向きません。
ダウンロード前に確認すること
サムネイルで判断せず、変更前後スライダーを原寸で使ってください。小さければ何でも良く見えます。再構成が本当に効いたかどうかは、次の4か所に表れます。
- 顔 — 目、歯、生え際は、自信過剰なモデルの正体が出る場所です。肌が蝋のようだったり、目が描かれたように見えたら、2倍を試す合図です。
- 文字 — 小さな文字は、説得力をもって鮮明になるか、自信たっぷりの意味不明な形になるかのどちらかです。文字が元の文字のままか確かめてください。
- 細かい繰り返し模様 — レンガ、布の織り、木の葉、格子などは、モデルが推測を敷き詰めた箇所で規則的なちらつきが出ることがあります。
- 平坦な面 — 空、壁、スタジオ背景は滑らかなままであるべきです。そこにムラが出るなら、元画像は見た目以上に圧縮されていたということです。
速度・メモリ・プライバシー
セッション内の最初の処理ではAIモデルをダウンロードするため、2枚目以降より明らかに時間がかかります。その後はブラウザがモデルをキャッシュするので、以降の画像はすぐに始まり、ネットワーク接続がまったくなくても動き続けます。
WebGPUが使える環境ではモデルがグラフィックスハードウェア上で動き、一般的な写真なら数秒で終わります。使えない場合も、あらゆる最新ブラウザで動作するCPUフォールバックがありますが、速度はかなり落ちます。処理はタブ内で行われるため、空きメモリの少ないマシンで大きな素材を4倍にすると遅くなったり失敗したりします。他の重いタブを閉じるのは本当に効果があります。
この一連の処理にサーバーは一切関わりません。ページが画像を読み込み、お使いの端末上で処理し、ダウンロードとして返すだけです。アップロードの工程が存在しないので、誰かが保管したり、流出させたり、学習に使ったりできるファイルの複製もそもそも存在しません。