Kashubian audio
Basic exploration for a scraper
URL = "http://web.archive.org/web/20180625150625/http://www.miesiecznikpomerania.pl/audio"
e.g.: "5. Czego chcele Młodokaszebi.mp3 /POMERANIA 2012, nr 2/"
- Selector:
#accordion_sp1_id91 > div:nth-child(379) - pdf: http://www.bibliotekacyfrowa.eu/dlibra/show-content/publication/31780/edition/29632/?format_id=2
- pdf page: 55
Original format is DjVu: https://www.bibliotekacyfrowa.eu/Content/29632/download?format_id=1 Maybe worth working directly with it?
import requests
from bs4 import BeautifulSoup
import json
csb_audio_page = requests.get(URL)
assert csb_audio_page.status_code == 200, "Failed to fetch the page"
soup = BeautifulSoup(csb_audio_page.content, "html.parser")
testing = [
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > strong",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(5)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(8)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(9)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(10)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(12)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(24)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(26)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(27)",
"#accordion_sp1_id91 > div:nth-child(36) > div:nth-child(3) > p:nth-child(28)"
]
soup.select("#accordion_sp1_id91 > div:nth-child(3)")