vehicle_capacity)・フェンス・素材を Lucene 全文検索ではなく
専用の数値・boolean・文字列フィールドで eq フィルタ。
2台用 クエリで日本語アナライザが
「2 OR 台」に分割して 1台用/3台用が誤通過していた問題を解消。image_tags に含まれる
実際の台数タグ (1台用/2台用/3台用以上) を見て
ピッタリ一致を +60%、ミスマッチを ×0.18 でハードペナライズ。
case が 2台案件でも mainImage が 1台用なら image01 が上位に来る。直線的なカーポート
の TOP10 から曲線屋根が確実に除外されます。style_descriptors (8 軸) と
anti_descriptors (反義) を出力するよう拡張。
画像タグと一致した事例には +35% / タグ の強ブースト、
反義タグ ("直線的" に対する "曲線的/アール屋根" 等) には
×0.55 / タグ のペナルティを適用。
これにより、ベクトル類似度だけでは差別化できなかった
直線的なカーポート や 黒いカーポート 等の修飾語クエリで
上位 10 件が大幅に変わるようになりました。
0 件 だった
直線的 曲線的 アール屋根 折板 系
アルミ 木調 1台用 / 2台用 / 3台用以上
カーポートあり 等のスタイル/被写体タグが画像基準で一斉に整い、
バリエーション偏りと正確性が大幅に改善しました。
実際にブラウザから自然文で検索して上位画像を確認できます。常時公開しているため、PCの電源状態と無関係にアクセスできます。 無料tier (16GB RAM / CPU) で稼働しているため、アイドル後の初回アクセス時はウォームアップに数十秒かかる場合があります。
→ Azure UI を開く (https://yusu0420-garden-search-azure.hf.space)
Azure AI Vision multimodal + Azure AI Search + gpt-5.4-mini クエリ解析。任意の自然文を入力して上位画像を確認できます。
→ CLIP UI を開く (https://yusu0420-garden-search-clip.hf.space)
google/siglip2-large-patch16-256 をローカル CPU 推論。同一クエリ・同一後処理で Azure と比較できます。初回起動時はモデルロードに 30〜60 秒かかります。
→ search_test_report_100.html を開く
eq 厳密フィルタ + 画像レベルの台数ブースト + 商品名 → 屋根形状の確定マッピングgoogle/siglip2-large-patch16-256 1024-dim (ローカル CPU 推論, 全 2,521 画像エンコード済)画像 30 事例 (49 枚) を gpt-5.4-mini Vision で 8 カテゴリのスタイルタグに統制語彙で構造化抽出した結果。
背景/目的/対象範囲/使用技術/評価方法/実験結果/課題/考察/次フェーズ改善案/本番化に向けた論点/まとめ の 13 章構成。装飾なし、游ゴシック。
| 観点 | Azure | CLIP (SigLIP2-large) |
|---|---|---|
| 画像/テキスト共通空間 | Azure AI Vision multimodal | SigLIP2-large (1024-dim, sigmoid loss) |
| 事前学習言語 | 多言語対応 (日本語含む) | 多言語対応 (SigLIP2 は日本語含む 109 言語) |
| 画像認識の細粒度 | 商用クラウドで継続改善 | 研究モデル — 細部 (折板/アール屋根/フェンス等) は弱い |
| 運用コスト | API 従量課金 | 埋め込み事前計算後はゼロ (CPU 推論) |
| 2,521 画像の埋め込み生成 | 初期構築時のみ ~1 時間 | CPU で約 22 分 (再構築可能) |
| クエリ毎の推論 | Azure 多段ベクトル検索 (~1〜2 秒) | SigLIP2 テキスト encode + numpy cosine (~3〜5 秒) |
レポート ① と ② は 同一クエリ・同一後処理スタック で生成しています。 画像/テキスト共通空間のみが異なります。レポートを横並びで比較してご評価ください。