# Wikipediaのスクレイピング (/ja/developer-guides/common-sites/wikipedia)

<!-- agent-signals: reading_time_min: 2 · est_tokens: 822 · updated: 2026-07-30 -->
Related: [Amazonのスクレイピング](/ja/developer-guides/common-sites/amazon.md), [Etsyのスクレイピング](/ja/developer-guides/common-sites/etsy.md), [GitHub のスクレイピング](/ja/developer-guides/common-sites/github.md), [Firecrawl + n8n](/ja/developer-guides/workflow-automation/n8n.md)

研究や知識抽出、AIアプリケーションの構築に向けて、Wikipediaを効果的にスクレイピングする方法を学びます。

<div id="setup">
  ## セットアップ [#セットアップ]
</div>

```bash
npm install firecrawl zod
```

<div id="use-cases">
  ## ユースケース [#ユースケース]
</div>

* 調査の自動化とファクトチェック
* ナレッジグラフの構築
* 多言語コンテンツの抽出
* 教育コンテンツの集約
* エンティティ情報の抽出

<div id="scrape-with-json-mode">
  ## JSONモードでスクレイピング [#jsonモードでスクレイピング]
</div>

Zodスキーマを使用して、Wikipediaの記事から構造化データを抽出します。

```typescript
import { Firecrawl } from 'firecrawl';
import { z } from 'zod';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

const result = await firecrawl.scrape('https://en.wikipedia.org/wiki/JavaScript', {
    formats: [{
        type: 'json',
        schema: z.object({
            name: z.string(),
            creator: z.string(),
            firstAppeared: z.string(),
            typingDiscipline: z.string(),
            website: z.string()
        })
    }]
});

console.log(result.json);
```

<div id="search">
  ## 検索 [#検索]
</div>

Wikipedia の記事を検索します。

```typescript
import { Firecrawl } from 'firecrawl';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

const searchResult = await firecrawl.search('quantum computing site:en.wikipedia.org', {
    limit: 10,
    sources: [{ type: 'web' }], // { type: 'news' }, { type: 'images' }
    scrapeOptions: {
        formats: ['markdown']
    }
});

console.log(searchResult);
```

<div id="scrape">
  ## スクレイピング [#スクレイピング]
</div>

単一の Wikipedia 記事をスクレイピングします。

```typescript
import { Firecrawl } from 'firecrawl';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

const result = await firecrawl.scrape('https://en.wikipedia.org/wiki/Artificial_intelligence', {
    formats: ['markdown'], // 例: html, links など
    onlyMainContent: true
});

console.log(result);
```

<div id="map">
  ## Map [#map]
</div>

Wikipedia のポータルまたはカテゴリ内に存在するすべての URL を取得します。注: Map は URL のみを返し、コンテンツは含みません。

```typescript
import { Firecrawl } from 'firecrawl';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

const mapResult = await firecrawl.map('https://en.wikipedia.org/wiki/Portal:Computer_science');

console.log(mapResult.links);
// コンテンツなしでURLの配列を返す
```

<div id="crawl">
  ## クロール [#クロール]
</div>

Wikipedia のドキュメントやカテゴリ内の複数ページをクロールします。

```typescript
import { Firecrawl } from 'firecrawl';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

const crawlResult = await firecrawl.crawl('https://en.wikipedia.org/wiki/Portal:Artificial_intelligence', {
    limit: 10,
    scrapeOptions: {
        formats: ['markdown']
    }
});

console.log(crawlResult.data);
```

<div id="batch-scrape">
  ## バッチスクレイピング [#バッチスクレイピング]
</div>

複数の Wikipedia URL を同時にスクレイピングします。

```typescript
import { Firecrawl } from 'firecrawl';

const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });

// 完了を待つ
const job = await firecrawl.batchScrape([
    'https://en.wikipedia.org/wiki/Machine_learning',
    'https://en.wikipedia.org/wiki/Artificial_intelligence',
    'https://en.wikipedia.org/wiki/Deep_learning'],
    {
        options: {
            formats: ['markdown']
        },
        pollInterval: 2,
        timeout: 120
    }
);


console.log(job.status, job.completed, job.total);

console.log(job);
```
