allenai
Approximately 40M cleaned, filtered, and formatted open-access academic papers derived from S2ORC — a large multi-domain pretraining corpus for science-aware language models, spanning biology, chemistry, engineering, computer science, and physics.
Last 30 days
No queryable preview
This dataset is not available in a queryable form — usually an unusual file format or a repository too large to convert. The original source may still be readable.