Data Science · Chapter 9 of 43

Reading & Writing Data

pandas can read/write CSV, Excel, JSON, Parquet, SQL and more with one-line functions.

Parquet is preferred for large tabular data — it's columnar, compressed and preserves types.

Example 1 (python)
import pandas as pd
df = pd.read_csv('data.csv')
df.to_parquet('data.parquet')

CSV in, Parquet out.

Example 2 (python)
df.to_excel('report.xlsx', index=False)
df2 = pd.read_json('logs.json')

Excel and JSON I/O.

Key points

  • CSV: universal, human-readable.
  • Excel: for business stakeholders.
  • Parquet: fast + typed for large data.
  • index=False avoids extra columns on export.
💡 Note: For big data, prefer Parquet over CSV — same data, often 5-10× smaller and much faster to load.

📝 Quick Quiz

1. Which format preserves column types?

2. df.to_csv writes:

3. index=False: