Project:

Villanova

Company:

Villanova.ai

Open Source License:

ODC-BY-1.0


Functionality

This dataset is a metadata-enriched multilingual sample of the original FinePDFs dataset. FinePDFs is a large-scale collection of document-level texts extracted from PDF files, sourced primarily from Common Crawl. The dataset emphasizes high-quality document extraction, structural coherence, and large-scale coverage of technical, scientific, educational, and administrative content commonly distributed in PDF form. This release contains a 75,000-document sample drawn from FinePDFs and enriched with additional symbolic metadata layers designed to improve interpretability, licensing awareness, and semantic analysis of document-based web content.

IPCEI-CIS Referene Architecture

AI Layer, Data Layer

Keywords

common-crawl-derived, commoncrawl-pdfs, cross-lingual-corpus, data-governance, dataset-enrichment, dataset-sample, docling-rolmocr, document-ai, document-understanding, english-italian-french-german-spanish, european-languages, language-model-training, large-scale-text-corpus, license-aware-dataset, llm-pretraining-data, long-context-training, metadata-enriched-dataset, multilingual-dataset, multilingual-documents, pdf-extraction-dataset, pdf-ocr-extraction, pdf-text-corpus, pretraining-corpus, quality-filtering, readability-metrics, retrieval-augmented-generation-data, structured-metadata, text-from-pdfs, topic-classification, web-document-mining, web-scraped-documents