Scraping de GitHub
Aprende a hacer scraping y buscar en GitHub con las funciones principales de Firecrawl y Research Index
Aprende a usar las funciones principales de Firecrawl para hacer scraping de repositorios, issues y documentación de GitHub.
Hay dos formas de obtener datos de GitHub con Firecrawl. Puedes hacer scraping, mapeo o crawling de una URL específica de github.com (que es lo que se explica en el resto de esta página), o usar la búsqueda de GitHub de Research Index para descubrir de forma semántica issues, pull requests, discusiones y README relevantes en todo GitHub sin conocer la URL exacta.
npm install firecrawl zodExtrae datos estructurados de repositorios mediante esquemas de Zod.
import { Firecrawl } from 'firecrawl';
import { z } from 'zod';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const result = await firecrawl.scrape('https://github.com/firecrawl/firecrawl', {
formats: [{
type: 'json',
schema: z.object({
name: z.string(),
description: z.string(),
stars: z.number(),
forks: z.number(),
language: z.string(),
topics: z.array(z.string())
})
}]
});
console.log(result.json);Busca repositorios, issues o documentación en GitHub.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const searchResult = await firecrawl.search('machine learning site:github.com', {
limit: 10,
sources: [{ type: 'web' }], // { type: 'news' }, { type: 'images' }
scrapeOptions: {
formats: ['markdown']
}
});
console.log(searchResult);El Research Index de Firecrawl incluye un índice de GitHub que permite buscar semánticamente issues, pull requests, discusiones y archivos README indexados de repositorios públicos de GitHub. Resulta útil para encontrar detalles de implementación y soluciones de ingeniería previas cuando no conoces el repositorio ni la URL exactos.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const results = await firecrawl.research.searchGithub(
'how to handle rate limit retries with exponential backoff',
{ k: 10 }
);
console.log(results);También puedes acceder al mismo índice de GitHub a través del endpoint general /search usando la categoría github.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const searchResult = await firecrawl.search('exponential backoff retry', {
categories: ['github'],
limit: 10
});
console.log(searchResult);Consulta la guía de Research Index para ver cómo usarlo con Python, cURL, CLI y MCP.
Extrae una sola página de GitHub: un repositorio, un issue o un archivo.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const result = await firecrawl.scrape('https://github.com/firecrawl/firecrawl', {
formats: ['markdown'] // p. ej. html, links, etc.
});
console.log(result);Descubre todas las URL disponibles en un repositorio o sitio de documentación. Nota: Map devuelve únicamente las URL, sin contenido.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const mapResult = await firecrawl.map('https://github.com/vercel/next.js/tree/canary/docs');
console.log(mapResult.links);
// Devuelve un array de URLs sin contenidoRastrea varias páginas de un repositorio o de la documentación.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
const crawlResult = await firecrawl.crawl('https://github.com/facebook/react/wiki', {
limit: 10,
scrapeOptions: {
formats: ['markdown']
}
});
console.log(crawlResult.data);Extrae varias URL de GitHub simultáneamente.
import { Firecrawl } from 'firecrawl';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
// Esperar a que finalice
const job = await firecrawl.batchScrape([
'https://github.com/vercel/next.js',
'https://github.com/facebook/react',
'https://github.com/microsoft/typescript'],
{
options: {
formats: ['markdown']
},
pollInterval: 2,
timeout: 120
}
);
console.log(job.status, job.completed, job.total);
console.log(job);Extrae datos estructurados de múltiples repositorios a la vez.
import { Firecrawl } from 'firecrawl';
import { z } from 'zod';
const firecrawl = new Firecrawl({ apiKey: process.env.FIRECRAWL_API_KEY });
// Esperar a que finalice
const job = await firecrawl.batchScrape([
'https://github.com/vercel/next.js',
'https://github.com/facebook/react'],
{
options: {
formats: [{
type: 'json',
schema: z.object({
name: z.string(),
description: z.string(),
stars: z.number(),
language: z.string()
})
}]
},
pollInterval: 2,
timeout: 120
}
);
console.log(job.status, job.completed, job.total);
console.log(job);