arXivのソース公開仕様がはらむ情報漏洩の盲点
学術論文のプレプリントサーバとして機能する「arXiv」では、公開されたPDFの裏で、論文の再現性や再利用性を担保するためにLaTeXのソースファイル(.tar.gz形式のアーカイブ)をそのまま一般公開する仕様を採用している。研究者が論文を投稿する際、図表データやスタイルファイル、ビルド用のスクリプトなどをまとめてアップロードするが、この圧縮ファイル内に論文本文には現れない機密情報や不要なローカルファイルが混入しているケースが極めて多い。今回の調査により、公開されたソースアーカイブの約9割において、何らかの非公開情報や意図しないデータがアクセス可能な状態で放置されている実態が明らかになった。
270万件の調査から判明した漏洩データの分類と具体的な数値
研究チームがarXivに登録された約270万件の論文ソースデータを対象に静的解析を実施したところ、検出された漏洩情報の種類は多岐にわたる。ソースコード内のコメントアウト部分に残された未公開の議論や、ローカル環境の絶対パス、さらにはクラウドサービスの認証情報までが含まれていた。以下は、調査によって検出された主な機密情報および不要データの分類と、その検出比率のサマリーである。
| 検出された情報タイプ | 具体的な内容例 | 検出率・影響度 |
|---|---|---|
| コメントアウトされたテキスト | 査読者への不満、未公開のアイデア、共同研究者間の議論 | 約85%の論文で確認 |
| ローカル環境の絶対パス | ユーザー名を含むディレクトリ構造、内部サーバ名 | 約70%の論文で確認 |
| 認証情報・シークレット | APIキー(OpenAI、AWS等)、データベース接続パスワード、SSH秘密鍵 | 数千件のファイルで直接検出 |
| 位置情報・個人情報 | 実験データのメタデータに含まれるGPS座標、自宅のIPアドレス | 特定のデータセットを伴う論文に偏在 |
LaTeXビルド環境における情報混入のメカニズムと対策
LaTeXのビルドプロセスでは、補助ファイル(.aux、.log、.outなど)が自動生成される。研究者がこれらのファイルをクレンジングせずにフォルダごと圧縮してarXivに送信することが、情報混入の主な要因となっている。特に、Gitなどのバージョン管理システムで「.gitignore」を用いて除外しているファイルであっても、手動でZIP化する際に巻き込んでしまうミスが多発している。この問題を防ぐため、投稿者はアップロード前に「latexmk -c」などのコマンドを用いてビルド生成物を削除するか、arXiv専用の送信パッケージ作成ツールを利用して、ソースコードと必要な画像ファイルのみを厳選してパッケージングする運用の徹底が求められる。


コメント