Azure

Google Cloud StorageとAzure Blob Storage間でファイルを並列コピー

こんにちは、エクスチュアの權泳東(権泳東/コン・ヨンドン)です。

今回はGCSとAzure Blob間でファイルを並列コピーする方法についてです。

GCS <=> S3はTransferサービスがありますが、GCS <=> Blobはお手軽に使えるダイレクトなものがありません。

というわけで、コマンドラインでササっと片付けました。

1. VMインスタンスを作成する

GCPまたはAzure上にVMインスタンスを用意します。
私はAzureのVMで東日本リージョンにUbuntuインスタンスを1台立ててるので、今回はそれを使います。

2. VMに必要なツール類をインストールする

GCS -> Blobにファイルをコピーするにあたって使ったツール類は以下のものです。
それぞれ手順に従ってインストールします。

Azure CLI
blobfuse
Google Cloud SDK
Cloud Storage FUSE
GNU Parallel ※aptでインストール可

3. BlobとGCSをUbuntuにマウントする

上記でインストールしたblobfuseとgcsfuseを使って、BlobとGCSをホームディレクトリ配下にマウントします。
~/blob と ~/gcs にそれぞれマウントしました。

blobfuse

$ blobfuse ~/blob --tmp-path=/mnt/blobfusetemp --config-file=/home/hoge/fuse_connection.cfg -o attr_timeout=240 -o entry_timeout=240 -o negative_timeout=120

fuse_connection.cfgの中身はこのようになってます。

accountName ストレージアカウント名
accountKey アカウントキー
containerName Blobコンテナ名

gcsfuse

$ gcsfuse mygcsbucketname ~/gcs

4. GNU Parallelを使って並列コピーする

それぞれFUSEを使ってファイルシステムにマウントしたので、あとはcpコマンドなりrsyncで同期する事も出来ますが、ファイルが沢山あるので今回はparallelを使って並列コピーしました。
このように使います。

$  ls gcs/*.csv | parallel -X -r -j10 cp -v {} ~/blob

これで、gcs内のCSVファイルを同時に10ファイルずつblobにコピーします。

上記で使ったparallelコマンドのオプションですが、

-X … 引数の置き換え。パイプで渡された入力と{}を置き換えます。
-r … 標準入力が空白だけだったら無視。
-j … 同時実行のジョブ数。デフォルトはCPUコア数なので、CPU以上の数を同時実行したい場合は-jの後ろに同時実行数をつける。

というわけで、GCSとBlobをVMにマウントしてparallelで同時コピーというお手軽解決策でした。

弊社ではデジタルマーケティング領域とビッグデータ領域にまたがる分析業務を主に行っておりまして、この分野ではLinuxとマルチクラウドは欠かせない技術です。
弊社へのお問合わせはこちらからどうぞ

ブログへの記事リクエストはこちらまで

【Tips】ファネル機能について前のページ

Sansanで名刺を取り込んだらSlackで社内共有する(Zapier利用)次のページ

ピックアップ記事

  1. 最速で理解したい人のためのIT用語集

関連記事

  1. Google BigQuery

    Tableau : BigQueryでLOD計算が使えない場合の対処法

    こんにちは、エクスチュアの渡部です。Tableau×BigQu…

  2. Google BigQuery

    BigQueryでWindow関数を用いて、累積和を計算する

    こんにちは。エクスチュアでインターンをさせて頂いている中野です。今…

  3. Google Cloud Platform

    Looker: LookerbotでSlackにグラフ画像をスケジュール投稿する

    こんにちは、エクスチュアの權泳東(権泳東/コン・ヨンドン)です。…

  4. Google BigQuery

    GCP: 今月のGCP課金額をslackに自動的に書き込む

    こんにちは、エクスチュアの權泳東(権泳東/コン・ヨンドン)です。…

  5. Adobe Analytics

    Adobe AnalyticsのDatafeedをBigQueryのColumn-based Tim…

    こんにちは、エクスチュアの權泳東(権泳東/コン・ヨンドン)です。…

  6. Google Cloud Platform

    Vertex AI Embeddings for Text によるテキストエンベディングをやってみた…

    こんにちは、石原と申します。自然言語処理(NLP)は近年のA…

カテゴリ
最近の記事
  1. Fivetranからdbtプロジェクトを実行する
  2. Account Engagementで送るメールをマルチエー…
  3. 協力と裏切りの理論
  4. 【Snowflake Tips】Content-Typeには…
  5. データ連携を自動化!Fivetranの概要・料金とスプレッド…
  1. ブログ

    マーケティングオートメーションの根幹:リードについて解説してみた!
  2. Google BigQuery

    GCPのBQMLを使ってKaggleコンペに挑んでみた(その1)
  3. Generative AI

    LangGraphのソースコードから見る今更聞けないAIエージェント実装(cre…
  4. Adobe Analytics

    Adobe AnalyticsとGoogle Analyticsの違い② サンプ…
  5. Google Apps Script(GAS)

    GASを利用してWebスクレイピングをやってみよう②
PAGE TOP