【フルリモート/週5】Python 検索アルゴリズム・アーキテクト(大規模検索基盤のモダナイゼーションとハイブリッド検索の極限追求)

案件要件
- 職種
- エンジニア
- 業務内容
- システム開発・運用SES
- 報酬目安
- 4,400 ~ 4,900円/時
- 稼働時間目安
- 週5日 (時間目安 160時間)
- はたらく場所
- フルリモート
- スキル
【フルリモート/週5】Python 検索アルゴリズム・アーキテクト(大規模検索基盤のモダナイゼーションとハイブリッド検索の極限追求)
お任せしたいこと
自社で展開する数千万アイテムを抱える大規模ECプラットフォーム、または膨大なドキュメントを扱う巨大メディアにおいて、ユーザーが「本当に欲しい情報」に瞬時に辿り着ける検索体験(Search UX)を根底から作り直すアーキテクトをお任せします。
「とりあえずElasticsearchにデータを流し込んだだけのキーワード検索」が引き起こす「0件ヒット(表記ゆれ)」や「ノイズだらけの検索結果」といったビジネスの機会損失を徹底的に排除し、自然言語処理(NLP)を用いた高度な形態素解析パイプラインの構築や、BM25とベクトル検索(Semantic Search)を組み合わせたハイブリッド検索を泥臭く実装することで、プロダクトのコンバージョン率を極限まで引き上げる中核的なポジションです。
具体的な業務内容
・Python(FastAPI等)と Elasticsearch / OpenSearch を活用した、数万QPSの高トラフィックに耐えうるスケーラブルな検索APIの設計・開発
・MeCab、SudachiPy等の形態素解析器とカスタム辞書を用いた、同義語(Synonym)展開、表記ゆれ吸収、および未知語対応の泥臭いチューニング
・Transformerモデル(Hugging Face等)を用いたテキストの埋め込み(Embedding)と、QdrantやMilvus等のベクトルデータベースを活用したセマンティック検索基盤の構築
・キーワード検索(スパース)とベクトル検索(デンス)のスコアを最適にブレンドするハイブリッド検索の実装と、Reciprocal Rank Fusion (RRF) 等を用いたランキングアルゴリズムの最適化
・XGBoostやLightGBMを活用し、ユーザーの行動ログ(クリック、購買履歴)に基づく機械学習ランキングアルゴリズム(Learning to Rank: LTR)の構築
・検索精度を定量的に評価するための指標(NDCG, MAP, MRR等)の定義と、A/Bテストを通じた継続的なアルゴリズム改善の泥臭いサイクル回し
・インデックス更新のリアルタイム性を担保する、Apache Kafka等のストリーミングデータパイプラインと非同期バッチ処理の設計
・検索クエリの遅延(レイテンシ)を数ミリ秒単位で削るための、Elasticsearchのシャード設計、キャッシュ戦略、およびJVMのプロファイリングとチューニング
必須スキル・経験
・Pythonを用いたバックエンド開発、またはデータ処理パイプラインの構築実務経験(目安として3年以上)
・Elasticsearch、OpenSearch、または Solr 等を用いた検索システムの本番環境での構築・運用・チューニング経験
・自然言語処理(NLP)の基礎知識、および形態素解析ツールを用いたテキスト前処理の経験
・検索ランキングや情報検索(Information Retrieval)に関する基礎的な知識とアルゴリズムへの理解
・Git / GitHubを用いたプルリクエストベースでのチーム開発、およびコードレビュー経験
歓迎スキル・経験
・Learning to Rank(LTR)を用いた検索ランキングの最適化経験
・ベクトルデータベースを用いたRAG、またはセマンティック検索の実装経験
・大規模トラフィックを捌く分散システムのアーキテクチャ設計経験
・ユーザー行動ログを用いた機械学習モデルの開発、およびA/Bテストの実務経験
・Pythonの非同期処理(asyncio)や型ヒント(Type Hints)を用いた堅牢なシステム開発経験
開発・業務環境
開発言語:Python 3.11+
検索エンジン:Elasticsearch (または OpenSearch)
NLP・MLフレームワーク:SudachiPy, Hugging Face Transformers, LightGBM, XGBoost
ベクトルDB:Qdrant, Milvus (または Elasticsearch/OpenSearchのk-NN機能)
Webフレームワーク:FastAPI
データパイプライン:Apache Kafka, Apache Airflow
インフラ・環境:AWS または GCP, Docker, Kubernetes
コミュニケーション・管理:GitHub, Jira, Slack, Zoom
プロジェクトチームについて
「検索は単なる一機能ではなく、プロダクトの売上を直接的に左右する心臓部である」と認識し、泥臭い辞書メンテナンスから最新のベクトル検索まで手段を選ばず精度向上に執念を燃やすコア検索チームへの配属となります。
「ユーザーの検索意図」という正解のないパズルに直面した際にも、経験や勘に頼る(属人的なヒューリスティック・ルールを書き連ねる)ことを極めて嫌い、A/Bテストの結果とNDCGのスコアを直視し、仮説検証を論理的かつ科学的に回す手堅いカルチャーです。検索インデックスが肥大化してレイテンシが跳ね上がった際にも、安易にノードをスケールアウトするのではなく、不要なフィールドの排除やマッピング設計まで泥臭く見直す実直なメンバーが集まっています。
求める人物像
・「検索エンジンにデータを投げるだけのインフラ屋」ではなく、自然言語の曖昧さと向き合い、ユーザーが意図した情報にたどり着くまでの導線を技術で美しく設計することに知的好奇心を持てる方
・辞書の登録やシノニムの定義といった地道で泥臭い作業を軽視せず、それらがアルゴリズム全体に与える絶大なインパクトを理解し、運用をシステム化できる方
・機械学習(ML)の高度な知識と、バックエンドシステム(インフラ)のレイテンシ要件という相反する制約の中で、ビジネス価値を最大化する現実的なトレードオフ判断ができる方
仕事の魅力
ECサイトや大規模メディアにおいて、「検索体験の質の低さ=即離脱」を意味する現代において、検索アルゴリズムの改善は数%のコンバージョン率向上(=数億円の売上増)をダイレクトにもたらします。情報検索の古典的なアプローチ(BM25)と、最新のAI技術(セマンティック検索・LTR)をハイブリッドに融合させる極めて難易度が高く泥臭い経験を通じて、単なる「Pythonバックエンドエンジニア」や「データサイエンティスト」を完全に凌駕し、世界中のテック企業から最も渇望される「検索アルゴリズム・アーキテクト(Search Engineer)」としての圧倒的な市場価値を築くことができます。
働き方
リモート環境
[フルリモート] 基本的にフルリモートで働いていただけます。
株式会社Kaizen Tech Agent
株式会社Kaizen Tech Agentは、「人と技術をつなぐ」ことを企業理念に掲げ、日々向上していく『技術』と『人』を最適な形でむつび付け提供することで、
お客様にとって真にプラスとなる価値でありたいと考えております。
私たちはそれぞれの個性を尊重し、ほっとする和みの社風でありながら、変化する時代に対して受け身にならず、未来への挑戦心を宿しています。
事業領域は、WEBアプリ開発、業務システム開発、スマホアプリ開発、インフラ構築など幅広く展開しており、
フリーランス様に対して最適な案件をご提案させて頂いております。どんな些細な事でも結構ですので是非いつでもお気軽にご相談ください。
