Wayback Machine и A-Parser
Старые статьи, цены и описания исчезают из живого веба вместе с редизайнами и удалёнными разделами. По данным Pew Research Center, 38% страниц из выборки 2013 года были недоступны к октябрю 2023 года. Снимки Wayback Machine помогают вернуть этот исторический слой, но обычный обход архива медленный и приносит в данные панели Wayback и служебные скрипты.
В A-Parser для этой задачи есть два практических сценария:
🧩 No-Code-конвейер: Net::HTTP -> HTML::ArticleExtractor получает URL через CDX API, скачивает чистые снимки и сохраняет результат в JSONL. ⚙️ Готовый TypeScript-парсер JS::WaybackCDX: находит снимки, нормализует и дедуплицирует URL, очищает текст через Mozilla Readability и сохраняет отдельные Markdown-файлы с YAML Frontmatter. 🧹 Режим id_: в ссылке на снимок убирает тулбар и внедрённые скрипты Wayback, чтобы в выгрузку попал исходный HTML страницы.