画像の「似てる度」を測る話!
機械学習を使った画像の類似度比較として、最近こういうのをやってるよ:FastViT などの Vision Transformer(ViT)系モデルを headless(分類ヘッドなし)で使って、画像を入力すると数百次元のベクトルが出てくる。それを2枚の画像で比較して、コサイン類似度が1に近いほど「似た画像」と判定する、という手法。
顔認識やECサイトの類似商品検索とかでよく使われてるやつですね🎯
コサイン類似度ってなに
ざっくり説明すると、ベクトル(数字の配列)が同じ方向を向いていれば1、直交してれば0、逆方向なら-1になる指標。画像から抽出した特徴ベクトル同士で計算することで「どのくらい似てるか」を数値化できます。
コサイン類似度 = (A・B) / (|A| × |B|)
ViT が出力する数百次元のベクトルはいわばその画像の「見た目の指紋」みたいなもので、同じ被写体の画像なら類似度が高くなる、という前提で使います。
問題:背景がノイズになる
さて、人物の全身を比較したいとき。例えば「同じ服を着た人を探したい」みたいなユースケース。
ViT(特にアテンション機構を持つもの)は画像全体を見てるので、背景が派手だったり独特の模様があったりすると、そっちに注目しちゃうんです〜。
白背景の人物A と 花柄の壁の前に立つ人物B → 全然別人なのに「似てない」判定 花柄の壁の前に立つ人物A と 花柄の壁紙をトリミングした画像C → 「似てる」判定が出てしまう
これはアテンションマップを可視化するとよくわかって、背景に強い視覚的パターンがある場合、ViT のアテンションがそこに集中していることが確認できます。人物をちゃんと見てくれてない😩
先行研究:背景マスクは有効という話
この問題、ちゃんと研究として取り組まれてます。
ICCV 2023 のワークショップで発表された Masking Strategies for Background Bias Removal in Computer Vision Models(Aniraj et al., 2023)という論文は、まさにこのテーマを扱ってる。
この論文では、背景バイアスを除去する戦略を2種類定義してます:
- Early Masking(早期マスク): 入力画像レベルで背景をマスクしてからモデルに入力する
- Late Masking(後期マスク): モデルの中間層の特徴マップに対してマスクをかける
結論として「Early Masking の方が OOD(Out-of-Distribution、学習分布外)な背景に対して頑健性が高い」という実験結果が出ています。ViT に関しては特に Early Masking + Early Masking でテストした場合のOOD性能向上が顕著だったとのこと。
さらに人物の再識別(ReID)の文脈でも同様のアプローチがあって、PS-ReID(2025)のような研究では、セグメンテーションマスクと特徴量抽出を統合したアーキテクチャが提案されていますし、PersonViT(2024)では ViT と自己教師あり学習で人物の局所的な fine-grained 特徴を抽出する研究がされています。背景の影響を排除して人物の特徴だけを取り出すというアイデアは、研究としてのコンセンサスが形成されてきているわけです。
解決策:セグメンテーションマスク + 背景ベタ塗り
実際のアプローチとして:
- 人物セグメンテーション:Segment Anything(SAM)などのセグメンテーションモデルで人物の輪郭を検出し、バイナリマスクを生成
- 背景塗りつぶし:マスク外(背景)を特定の単色で塗りつぶす
- ViT に入力:背景が均一な色になった画像を特徴量抽出に使う
手順はシンプルなんですが、ここで一つ疑問が生まれます。
「特定の色」って何色がいいの?
背景を何色で塗る? → ImageNet 平均色がベスト
直感的には「真っ黒(#000000)」や「真っ白(#FFFFFF)」を思い浮かべますよね。でも実際にやってみると、これらは意外と良くない結果になりがちです。
理由を理解するために、ViT に画像を入れる前に必ず行う「正規化(Normalization)」の話をします。
正規化とは
ニューラルネットへの入力は、そのモデルが学習したときと同じ前処理を施す必要があります。PyTorchでよく見るやつ:
transforms.Normalize(mean=[0.485, 0.456, 0.406],
std=[0.229, 0.224, 0.225])
この処理の中身はシンプルで、各チャンネルごとに
正規化後の値 = (元の値 - mean) / std
というだけです。ToTensor() で [0, 255] → [0.0, 1.0] に変換された後、さらにこの正規化がかかります。
ImageNet 平均色 = 正規化後ゼロ
ここが面白いところで、元の値 = mean のとき、正規化後は 0 になります。
ImageNet の mean 値は
- R: 0.485(≒ 123.7 / 255)
- G: 0.456(≒ 116.3 / 255)
- B: 0.406(≒ 103.5 / 255)
これらはそれぞれ ImageNet の学習データセット(約128万枚)全体を通じて計算されたチャンネルごとの平均ピクセル値です。
この色(おおよそ #7B7468、くすんだ茶灰色みたいな色)で背景をベタ塗りしてから正規化すると、背景ピクセルの正規化後の値が ちょうど 0 になります。
# 例:R チャンネル
(0.485 - 0.485) / 0.229 = 0.0 ✅
(0.000 - 0.485) / 0.229 = -2.117 # 真っ黒は負の大きな値になる
(1.000 - 0.485) / 0.229 = +2.249 # 真っ白は正の大きな値になる
真っ黒や真っ白で塗ると、正規化後にゼロどころか±2以上の値になってしまう。これは「背景に強い信号がある」とモデルが判断してしまう原因になります。
平均色で塗ることで、背景パッチから出てくる信号を数学的に最小化(ゼロに近づける)できるわけです。これが「ImageNet 平均色が最もノイズの少ない背景色になる」理由です(´∀`*)
モデルやデータセットによって平均色は違う
重要な注意点として、この「魔法の色」はモデルによって異なります。
以下は代表的なモデルと、それぞれの正規化パラメータ:
| モデル | mean (R, G, B) | std (R, G, B) |
|---|---|---|
| ImageNet 系(ResNet, ViT 等) | 0.485, 0.456, 0.406 | 0.229, 0.224, 0.225 |
| CLIP(OpenAI) | 0.4815, 0.4578, 0.4082 | 0.2686, 0.2613, 0.2758 |
| Inception / 一部の ViT | 0.5, 0.5, 0.5 | 0.5, 0.5, 0.5 |
| YOLO 系 | 0.0, 0.0, 0.0 | 1.0, 1.0, 1.0 |
各モデルのゼロ信号カラーをまとめると:
- ImageNet 系:R≈124, G≈116, B≈104(くすんだ茶灰色
#7B7468) - CLIP:R≈123, G≈117, B≈104(ほぼ同じ、少し違う)
- Inception/ViT(±1正規化):R=128, G=128, B=128(中間グレー
#808080) - YOLO:mean=0 なので、塗りつぶし不要(どんな色も正規化後に値が残る)
なぜ値が違うのか?それはそれぞれのモデルが学習したデータセットが異なるからです。
ImageNet(約128万枚の自然画像)と CLIP の学習データ「WebImageText」(インターネット上の画像テキストペア)では、データセット全体の色分布が異なります。CLIP の値が ImageNet にかなり近いのは、どちらも自然画像ベースのため似た分布になっているからですね。
Input Normalization: What We Know, What We Don't, and Why It Matters でも詳しく解説されてますが、正規化の mean/std はそれぞれのモデルが学習に使ったデータセットの統計量であり、モデルごとに固有のものです。
つまり、もし FastViT ではなく CLIP のビジョンエンコーダを使う場合は CLIP の mean 色で背景塗りつぶしをする必要があるし、自前のデータで追加学習したモデルならその学習データの平均色を計算しないといけません。
まとめ:やったことの整理
- 人物の全身を特徴量で比較したい → ViT の headless 出力ベクトル + コサイン類似度
- 背景がノイズになる問題 → ViT のアテンションが背景に引っ張られる
- 先行研究でも有効と確認されてる → Early Masking(入力レベルでの背景除去)が ViT に効く
- 解決:セグメンテーションマスク + 背景ベタ塗り → マスク外を特定色で塗ってからViT入力
- その「特定色」はモデルの学習データの平均色 → 正規化後にゼロになることで背景信号を最小化
- モデルが変われば最適な色も変わる → 自分が使うモデルの mean 値を確認しよう
地味な前処理の話ではあるんですが、「なぜその色か」の理由を理解しておくと、モデルを変えたときも対応できるし、根拠を持って実装できるのが気持ちいいところ(・∀・)
FastViT に限らず、ImageNet 事前学習の ViT 系モデルを使っているなら同じアプローチが使えるはずです☆
参考リソース
- Masking Strategies for Background Bias Removal in Computer Vision Models (Aniraj et al., ICCV 2023 Workshop)
- PS-ReID: Advancing Person Re-Identification and Precise Segmentation (arxiv 2503.21595)
- PersonViT: Large-scale Self-supervised Vision Transformer for Person Re-Identification (arxiv 2408.05398)
- Input Normalization: What We Know, What We Don't, and Why It Matters - Albumentations Blog
- Understanding Image Normalization in CNNs - Laurent Perrinet
- CLIP normalization constants - OpenAI GitHub Issue

☆ この日記へのコメント ☆
コメントは 掲示板 からお願いします♪