【フルリモート/週5】Python 分散クローラー・データアーキテクト(数百億ページ規模の大規模スクレイピング基盤とLLM学習データ構築) お任せしたいこと 自社で展開する大規模なマーケットインテリジェンス事業、または独自LLM(大規模言語モデル)の事前学習(Pre-training)データ構築基盤において、インターネット上に散在する数百億規模のWebページやドキュメントを効率的かつ倫理的に収集する「大規模分散クローリング基盤」の設計・構築をお任せします。 「BeautifulSoupで適当に書いた使い捨てのスクリプトをCronで回す」といった脆いデータ収集プロセスを徹底的に排除し、ScrapyやCelery、Apache Kafkaを駆使した堅牢な分散タスクキューの構築から、高度なBot対策(CloudflareやDatadome等)をシステム的に突破する泥臭いプロキシ戦略・ヘッドレスブラウザ制御までを牽引することで、AI時代の「データの源泉」を圧倒的なスループットで確保し続ける中核的なポジションです。 具体的な業務内容 ・Python(Scrapy, Scrapy-Redis)および非同期I/O(asyncio, aiohttp)を活用した、秒間数万リクエストを捌き切るスケーラブルな分散クローラーアーキテクチャの設計と実装 ・Playwright や Selenium を利用した、JavaScriptによる動的レンダリング(SPA)サイトや複雑な認証フロー、CAPTCHAを突破するための泥臭いヘッドレスブラウザ自動化パイプラインの構築 ・商業用・住宅用プロキシネットワーク(Proxy Pool)の動的ローテーション、およびUser-AgentやTLSフィンガープリントの偽装による、対象サーバーに負荷をかけずにアクセスブロックを回避する高度なスクレイピング戦略の実装 ・収集したHTMLからノイズ(ヘッダー、フッター、広告)を排除し、LLMの学習に適した高品質なプレーンテキストを抽出するDOM解析と、正規表現を用いた泥臭いデータクレンジング ・MinHash や SimHash などのアルゴリズムを用いた、数十億レコードに及ぶテキストデータの重複排除(De-duplication)と品質フィルタリングの実装 ・Apache Kafka、または RabbitMQ を利用した、URLのキューイングからパース、保存までの非同期データストリーミング基盤の構築 ・対象サイトの非公開API(Internal API)のネットワークトラフィック(XHR/Fetch)を泥臭くリバースエンジニアリングし、HTML解析よりも高速かつ安定したJSONデータの抽出基盤への切り替え ・Kubernetes(EKS / GKE)環境における、クローラーPodのオートスケーリング設定およびメモリ/CPUリソースの極限のチューニング 必須スキル・経験 ・Pythonを用いたバックエンド開発、またはデータパイプラインの構築実務経験(目安として3年以上) ・Scrapy、BeautifulSoup、lxml等のライブラリを用いた大規模なWebスクレイピングプログラムの実装・運用経験 ・HTTPプロトコル、TCP/IP、およびWebブラウザのレンダリング機構に関する深い理解 ・RDBMS(PostgreSQL, MySQL)または NoSQL(MongoDB, Elasticsearch)を利用した大量データの保存・設計経験 ・Git / GitHubを用いたプルリクエストベースでのチーム開発経験 歓迎スキル・経験 ・Celery、Apache Kafka、Redis等を利用した分散タスクキューの設計・運用経験 ・Playwright、Selenium等を用いたE2Eテスト、またはヘッドレスブラウザの自動化経験 ・Webサイトの高度なアンチBotシステム(Cloudflare, Akamai, Datadome等)の回避・バイパス技術に関する知識 ・LLM(大規模言語モデル)の事前学習用データセット構築、または自然言語処理(NLP)向けの前処理経験 ・Docker / Kubernetesを利用したコンテナベースのインフラにおけるアプリケーション運用経験 開発・業務環境 開発言語:Python 3.11+ スクレイピング・ブラウザ自動化:Scrapy, Scrapy-Redis, Playwright, aiohttp, BeautifulSoup 非同期・タスクキュー:Celery, Apache Kafka, RabbitMQ, Redis データベース・検索:PostgreSQL, MongoDB, Elasticsearch データ処理・前処理:Pandas, PyArrow, MinHash インフラ・コンテナ:AWS または GCP, Docker, Kubernetes コミュニケーション・管理:GitHub, Jira, Slack, Zoom プロジェクトチームについて 「AI時代において、アルゴリズムの勝負はコモディティ化し、最終的な勝者は『独自の高品質なデータ』を握った者である」と確信し、インターネット上のあらゆる情報を構造化データへと変換することに執念を燃やすデータマイニング専門チームへの配属となります。 「対象サイトの仕様変更でスクリプトが落ちた」という日常茶飯事の事態に対しても文句を言うのではなく、DOMの変化に強い堅牢なXPath/CSSセレクタの設計や、異常検知アラートを泥臭く仕込む手堅いカルチャーです。相手サーバーの負荷を考慮し、robots.txtやクロールディレイ(Rate Limit)を遵守する倫理観を持ちながらも、APIの難読化(Obfuscation)に直面した際にはChrome DevToolsを開いてJavaScriptの処理を泥臭く解読し、パズルを解き明かす実直なメンバーが集まっています。 求める人物像 ・「単にライブラリを叩いてデータを抜く」こと以上に、HTTPリクエストヘッダの微細な違いやTLSハンドシェイクの挙動までを深く探求し、ハッカー的な知的好奇心を持てる方 ・対象サイトの予期せぬレイアウト変更や、理不尽なアクセスブロックといった「実世界の不確実性」に対して、パズルを解くように泥臭い回避策の実装を楽しめる方 ・無秩序なHTMLの海から、ビジネス的価値やAIの学習資産となる美しい「構造化データ」を抽出することにエンジニアとしての強い美学を持てる方 仕事の魅力 LLMの進化により「データの量と質」が企業の競争力を直接的に決定づける現代において、数十億規模のWebデータを安定的に収集・処理できる「大規模分散クローリング」の技術は極めてニッチかつ需要が爆発している領域です。高度なBot対策との技術的ないたちごっこや、分散システムの泥臭い限界突破の経験を通じて、単なる「Pythonスクリプト開発者」を完全に凌駕し、AIスタートアップやヘッジファンド、メガベンチャーが最も高額な条件で渇望する「データマイニング・アーキテクト」としての圧倒的な市場価値を築くことができます。 働き方 リモート環境 [フルリモート] 基本的にフルリモートで働いていただけます。