VSCodeのData Wranglerとは

採用はこちら

VSCodeの「Data Wrangler」は、Microsoftが提供しているデータ閲覧・クリーニング用の拡張機能です。

CSVやExcel、Parquetなどの表形式データをVSCode上で確認し、フィルタリングや並べ替え、欠損値処理、データ型の変更といった加工をGUIで行えます。

さらに、Data Wrangler上で実行した操作に対応するPython・Pandasコードを自動生成できる点が大きな特徴です。

そのため、Data Wranglerは単純なCSVビューアーではなく、データの確認から前処理、Pythonコードの生成までを支援するデータ分析ツールとして利用できます。

特に、Pandasを使ったデータ分析を始めたばかりの人や、データクリーニングを効率化したい場合に便利です。

目次

Data Wranglerでできること

Data Wranglerでは、表形式データに対してさまざまな操作を実行できます。

代表的な機能には、次のようなものがあります。

  • データの並べ替え
  • 条件によるフィルタリング
  • 不要な列の削除
  • 必要な列の選択
  • 列名の変更
  • データ型の変更
  • 欠損値の削除や補完
  • 重複行の削除
  • 新しい列の作成
  • 文字列の置換
  • One-hot encoding
  • グループ化と集計
  • データ分布や欠損値の確認
  • Pandasコードの自動生成
  • 加工済みデータのエクスポート

一般的なデータ分析では、分析そのものよりもデータを整える前処理に時間がかかることがあります。

Data Wranglerを利用すれば、こうした処理をGUIで確認しながら進められるため、データクリーニングの効率化につながります。

Data Wranglerを利用するための準備

Data Wrangler拡張機能をインストールする

まず、VSCodeにData Wranglerをインストールします。

VSCodeを起動し、左側の「Extensions」をクリックします。

WindowsやLinuxでは、次のショートカットでも拡張機能画面を開けます。

Ctrl + Shift + X

検索欄に、

Data Wrangler

と入力します。

Microsoftが提供している「Data Wrangler」を選択し、「Install」をクリックします。

同名または類似した拡張機能が表示される可能性もあるため、発行元がMicrosoftであることを確認しておくと安心です。

Python環境を用意する

Data Wranglerは、Pythonを利用してデータ処理を行います。

Microsoftの公式情報では、Python 3.8以上が必要とされています。

Pythonがインストールされているか確認する場合は、VSCodeのターミナルで次のコマンドを実行します。

python --version

環境によっては、次のコマンドを使用します。

python3 --version

たとえば、

Python 3.12.7

のように表示されれば、Pythonが認識されています。

実際に新しく環境を構築する場合は、特別な理由がなければ現在サポートされている比較的新しいPythonを利用するとよいでしょう。

Python拡張機能とJupyter拡張機能をインストールする

ローカルのPythonインタープリターをData Wranglerの実行環境として利用する場合は、Microsoftの「Python」拡張機能と「Jupyter」拡張機能も必要です。

VSCodeのExtensionsから、

Python

と、

Jupyter

を検索してインストールします。

Data WranglerをJupyter Notebookと組み合わせて利用する場合にも必要になります。

Pandasについて確認する

Data Wranglerでは、Pandasを利用してデータ処理を行います。

ただし、必ず事前に自分でPandasをインストールしなければならないわけではありません。

Data Wranglerを初めて起動すると、必要なPythonパッケージが確認され、不足している場合は自動的にインストールが試みられます。

自動インストールに失敗する場合などは、手動でPandasをインストールできます。

pip install pandas

仮想環境を利用している場合は、Data Wranglerで使用するPython環境にPandasがインストールされているか確認しましょう。

Data Wranglerが対応しているファイル形式

Data Wranglerでは、代表的な表形式ファイルを直接開くことができます。

主な対応形式は次のとおりです。

.csv
.tsv
.xls
.xlsx
.parquet

CSVやTSVでは区切り文字を指定でき、Excelファイルでは対象となるシートを選択できます。

また、Visual Studio MarketplaceではJSON Lines形式からの起動についても案内されています。

ただし、VSCode公式ドキュメントの対応ファイル形式一覧では、CSV、TSV、Excel、Parquetが中心に記載されています。

そのため、JSONLを利用する場合は、使用しているData Wranglerのバージョンで対応状況を確認するとよいでしょう。

CSVファイルをData Wranglerで開く方法

VSCodeでフォルダーを開く

まず、対象となるCSVファイルが保存されているフォルダーをVSCodeで開きます。

メニューから、

ファイル
↓
フォルダーを開く

を選択します。

たとえば、

sales.csv

というCSVファイルを開くとします。

内容が次のようになっているとします。

date,product,price,quantity
2026-09-01,Apple,150,10
2026-09-02,Orange,120,15
2026-09-03,Banana,100,20

Open in Data Wranglerを選択する

VSCodeのExplorerで、

sales.csv

を右クリックします。

表示されたメニューから、

Open in Data Wrangler

を選択します。

すると、CSVの内容がData Wrangler上に表形式で表示されます。

ExcelやParquetなどの対応ファイルも、基本的には同じような方法で開けます。

Data WranglerのViewing modeとは

Data Wranglerには、大きく分けて「Viewing mode」と「Editing mode」があります。

ファイルを開いた直後は、基本的にViewing modeでデータを確認します。

データを表形式で確認する

Viewing modeでは、データが表形式で表示されます。

たとえば、

dateproductpricequantity
2026-09-01Apple15010
2026-09-02Orange12015
2026-09-03Banana10020

のように確認できます。

Excelやスプレッドシートに近い感覚でデータを閲覧できるため、CSVをそのままテキストとして確認するよりも内容を把握しやすくなります。

Quick Insightsでデータの特徴を確認する

Data Wranglerには「Quick Insights」が用意されています。

Quick Insightsでは、列ごとにデータの特徴を確認できます。

たとえば、次のような情報を確認できます。

  • データの分布
  • 値の出現頻度
  • 欠損値
  • 異なる値の数

数値列であれば値の分布を確認し、異常に大きい値や小さい値が存在しないかチェックできます。

文字列の列では、それぞれの値がどの程度出現しているか確認することもできます。

データを並べ替える

列ヘッダーから、データを昇順または降順に並べ替えられます。

たとえば、価格を表すprice列を降順にすると、価格の高いデータから順番に確認できます。

大量のデータから上位または下位の値を探す場合に便利です。

データをフィルタリングする

列に条件を設定して、必要なデータだけに絞り込むこともできます。

たとえば、

price >= 1000

という条件を設定すれば、価格が1,000以上のレコードを中心に確認できます。

大量のデータから特定条件に一致するレコードを探す場合に便利です。

Data WranglerのEditing modeとは

データを実際に加工する場合は、Editing modeを利用します。

Viewing modeがデータの閲覧や探索を中心としたモードなのに対し、Editing modeではデータのクリーニングや変換を行えます。

Editing modeでは、主に次のような機能を使用します。

Operations
Cleaning Steps
Code Preview
Data Grid
Export

GUI操作によってデータを加工しながら、その処理に対応するPandasコードを確認できます。

Operationsでデータを加工する

Sortでデータを並べ替える

Sortでは、指定した列を基準に昇順または降順でデータを並べ替えられます。

Pandasで表現すると、次のような処理に相当します。

df.sort_values(by="price")

GUIから設定できるため、Pandasの構文を覚えていなくても操作できます。

Filterで必要なデータだけを残す

Filterを使うと、条件に一致する行だけを残せます。

たとえば、

price >= 1000

という条件を設定すれば、価格が1,000以上のデータだけに絞り込めます。

Change column typeでデータ型を変更する

列のデータ型を変更することもできます。

たとえば、

文字列 → 整数
文字列 → 日付
整数 → 文字列

といった変換です。

CSVでは、本来数値として扱いたいデータが文字列として読み込まれることがあります。

そのような場合に便利な機能です。

Drop columnで不要な列を削除する

分析に不要な列を削除できます。

たとえば、

memo
temporary
unused_column

などの列を削除できます。

Pandasでは、次のような処理に相当します。

df.drop(columns=["memo"])

Select columnで必要な列だけを残す

大量の列が含まれているデータから、分析に必要な列だけを残すこともできます。

たとえば、

date
product
price
quantity

の4列だけを使用するといった処理が可能です。

Create column from formulaで新しい列を作る

既存の列を使って、新しい列を作成することもできます。

たとえば、

price × quantity

によって売上金額を表すsales列を作成するとします。

Pandasでは、次のようなコードになります。

df["sales"] = df["price"] * df["quantity"]

Data Wranglerでは、このような処理をGUIから設定できます。

One-hot encodeでカテゴリーデータを変換する

カテゴリーデータをOne-hot encodingすることもできます。

たとえば、

color

red
blue
green

という列を、

color_red
color_blue
color_green

のような複数の列へ変換できます。

機械学習用のデータを作成するときなどに利用できます。

参考サイト

Data Wrangler for VSCode を試してみる #pandas – Qiita

欠損値をData Wranglerで処理する方法

欠損値を確認する

データ分析では、値が入っていない欠損データが含まれていることがあります。

たとえば、

productprice
Apple150
Orange
Banana100

のようなデータです。

Data Wranglerでは、欠損値の存在を確認したうえで、削除や補完を行えます。

Fill Missing Valuesで欠損値を補完する

「Fill Missing Values」を利用すると、欠損値を別の値で補完できます。

たとえば、数値データの欠損部分を中央値で補完することができます。

処理を設定すると、変更結果をData Gridで確認できます。

問題がなければApplyを選択して処理を適用します。

Code PreviewでPandasコードを確認する

Data Wranglerの大きな特徴の一つが「Code Preview」です。

GUIからデータ加工を設定すると、それに対応するPython・Pandasコードが自動的に生成されます。

たとえば、

priceが1000以上のデータだけを残す

という処理を設定すると、それに対応するPandasコードを確認できます。

Data Wranglerでは、

GUIで処理を設定
↓
Pandasコードを確認
↓
処理結果をプレビュー
↓
Apply

という流れで作業できます。

そのため、

このデータ処理をPandasではどのように書けばよいのか

を学ぶ用途にも向いています。

Code Previewのコードは編集できる

Code Previewでは、自動生成されたコードを確認するだけでなく、編集することもできます。

コードを調整すると、変更内容がデータにどのように影響するか確認できます。

GUIだけでは実現しにくい細かな処理を追加したい場合にも便利です。

Cleaning Stepsで加工履歴を確認する

Data Wranglerで適用したデータ加工は、「Cleaning Steps」に記録されます。

たとえば、

1. 欠損値を処理
2. price列を数値型へ変更
3. 不要な列を削除
4. price >= 1000でフィルタリング
5. sales列を作成

といった形で処理の流れを確認できます。

どの操作によってデータが変化したのか把握しやすいため、複数の加工を組み合わせる場合に便利です。

以前適用した処理の内容を確認したり、必要に応じて修正したりすることもできます。

Jupyter NotebookからData Wranglerを使う方法

DataFrameを作成する

Data WranglerはVSCodeのJupyter Notebookとも連携できます。

たとえば、Notebookで次のコードを実行します。

import pandas as pd

df = pd.read_csv("sales.csv")

df

DataFrameを出力すると、Data Wranglerで開くための操作が表示されます。

DataFrameの出力からData Wranglerを開く

Notebook上で、

df

や、

df.head()
df.tail()
display(df)

などを実行すると、DataFrameをData Wranglerで開ける場合があります。

「Open ‘df’ in Data Wrangler」などを選択すると、フルスクリーンのData Wrangler画面でデータを操作できます。

Variablesパネルから開く

Jupyter NotebookのVariablesパネルからDataFrameを選択し、Data Wranglerで開くこともできます。

たとえば、

df
sales_df
customer_df

といったDataFrame変数がある場合、対象の変数からData Wranglerを起動できます。

Notebook内でDataFrameを確認する

現在のData Wranglerでは、Notebookの出力部分からDataFrameを確認する統合された操作方法も用意されています。

簡単なデータ確認はNotebook内で行い、本格的なクリーニングを行いたい場合にData Wranglerのフル画面表示へ移行すると効率的です。

Data Wranglerで生成したコードをNotebookへ戻す

Data Wranglerでデータ加工が完了したら、生成されたコードをJupyter Notebookへエクスポートできます。

代表的な方法には、次のようなものがあります。

Export code back to Notebook and exit
Export data to a file
Copy code to clipboard

「Export code back to Notebook and exit」を利用すると、Data Wranglerで作成したデータクリーニング処理がPythonコードとしてNotebookへ追加されます。

そのため、

Data Wranglerでデータを確認
↓
GUIでクリーニング
↓
生成されたPandasコードを確認
↓
Notebookへ出力
↓
Pythonコードとして再利用

という流れで作業できます。

加工したデータをファイルとして保存する

Data Wranglerでは、生成コードだけでなく、加工済みのデータ自体もエクスポートできます。

たとえば、

sales_raw.csv
↓
Data Wranglerで加工
↓
sales_clean.csv

のように、元ファイルとは別のファイルとして保存できます。

CSVやParquet形式で書き出せるため、加工済みデータをほかの分析ツールで利用する場合にも便利です。

Data Wranglerは元データをすぐに変更しない

Data Wranglerを使用するうえで重要なのが、作業中に元データが直接書き換えられるわけではない点です。

Data Wranglerではサンドボックス化された環境でデータ加工を試せます。

そのため、

列を削除する
↓
結果を確認する
↓
問題があれば戻す
↓
別の処理を試す

といった試行錯誤がしやすくなっています。

加工済みデータを保存したい場合は、明示的にエクスポートします。

Data Wranglerの実践的な使い方

売上データをクリーニングする例

たとえば、ECサイトの売上データとして、

sales.csv

があるとします。

データには、

date
product
category
price
quantity
customer_id

などの列が含まれているとします。

Data Wranglerを使用すると、次のような流れでデータを整えられます。

sales.csvを開く
↓
欠損値を確認
↓
不要な列を削除
↓
priceのデータ型を確認・変更
↓
sales列を作成
↓
不要なレコードを除外
↓
売上順に並べ替える
↓
Pandasコードを確認
↓
コードまたはデータをエクスポート

GUIで試行錯誤した結果を最終的にPandasコードへ変換できるため、単発の作業だけでなく、同じ処理を繰り返し実行する仕組みにもつなげられます。

Data Wranglerが向いているケース

CSVの内容を素早く確認したい場合

CSVをテキストとして開くと、大量のデータは確認しにくくなります。

Data Wranglerを利用すれば、VSCode内で表形式として確認できます。

Pandasを学習している場合

Data WranglerではGUI操作に対応するPandasコードを確認できます。

そのため、

この操作をPandasではどう書くのか

を理解する学習ツールとしても利用できます。

データ分析前の前処理を行いたい場合

データ分析では、

欠損値処理
型変換
不要列の削除
フィルタリング
並べ替え
重複削除

などの前処理が必要になります。

Data Wranglerを利用すると、これらを視覚的に確認しながら進められます。

Jupyter Notebookを利用している場合

Data WranglerはVSCodeのJupyter Notebookと連携できます。

そのため、

Pandas
+
Jupyter Notebook
+
Data Wrangler

を組み合わせることで、データの読み込み、確認、クリーニング、分析までをVSCode内で進めやすくなります。

Data Wranglerが起動しない場合の対処方法

Python環境を確認する

Data Wranglerが正常に起動しない場合は、使用しているPython環境を確認します。

WindowsやLinuxでは、

Ctrl + Shift + P

を押してコマンドパレットを開きます。

続いて、

Python: Select Interpreter

を検索します。

使用したいPython環境が選択されているか確認します。

仮想環境を利用している場合は、

.venv
venv
conda

など、想定した環境が選択されているか確認しましょう。

Python・Jupyter拡張機能を確認する

ローカルPythonをData Wranglerのランタイムとして使用する場合は、Python拡張機能とJupyter拡張機能が必要です。

無効になっていたり、正常にインストールされていなかったりすると、Data Wranglerが正常に起動しない可能性があります。

Data Wranglerのランタイムキャッシュを削除する

カーネルやPythonランタイムに問題が発生している場合は、コマンドパレットから、

Data Wrangler: Clear cached runtime

を実行する方法があります。

キャッシュされたランタイム情報を削除することで、問題が解消する場合があります。

UnicodeDecodeErrorが表示される場合

CSVをData Wranglerで開いたときに、

UnicodeDecodeError

が表示される場合があります。

原因の一つとして、CSVファイルがUTF-8以外の文字コードで保存されていることが考えられます。

日本語のCSVでは、Shift_JIS系やCP932などが使われている場合があります。

その場合は、Jupyter Notebookで文字コードを指定して読み込みます。

import pandas as pd

df = pd.read_csv(
    "sample.csv",
    encoding="cp932"
)

df

読み込みに成功したDataFrameをData Wranglerで開けば、データを操作できます。

ただし、すべての日本語CSVがCP932とは限りません。

ファイルの文字コードに合わせてencodingを指定する必要があります。

Data WranglerとPandasの違い

Data WranglerとPandasは、どちらか一方を使うものではありません。

役割が異なります。

Data Wrangler
→ GUIを使ってデータを確認・加工する

Pandas
→ Pythonコードを使ってデータを処理する

Data WranglerではPandasコードを生成できるため、両者を組み合わせる使い方が効果的です。

たとえば、

Data Wranglerで加工方法を検討
↓
生成されたPandasコードを確認
↓
Notebookへ出力
↓
Python処理として保存
↓
繰り返し実行

といった流れにできます。

GUIで試した処理を最終的にコード化できる点が、Data Wranglerの大きなメリットです。

Data Wranglerを使う基本的な流れ

初めてData Wranglerを利用する場合は、次の流れを覚えておくと分かりやすいでしょう。

VSCodeを起動
↓
Data Wranglerをインストール
↓
Python環境を用意
↓
必要に応じてPython・Jupyter拡張機能を用意
↓
CSVやExcelなどを開く
↓
Open in Data Wranglerを選択
↓
Viewing modeでデータを確認
↓
Editing modeへ切り替える
↓
Operationsから処理を設定
↓
Data Gridで結果を確認
↓
Code PreviewでPandasコードを確認
↓
Apply
↓
Cleaning Stepsで加工履歴を確認
↓
コードまたはデータをExport

Data Wranglerは、VSCode上でデータを視覚的に確認・加工しながら、その処理を再利用可能なPython・Pandasコードへ変換できる便利な拡張機能です。

CSVやExcelの内容を確認するだけでなく、データ分析や機械学習の前処理を効率化したい場合にも役立ちます。

特に、GUIで処理内容を試したあと、それをPandasコードとして保存・再利用したい場合にData Wranglerのメリットを活かしやすいでしょう。

以上、VSCodeのData Wranglerとはについてでした。

最後までお読みいただき、ありがとうございました。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!
目次