A collection of Jupyter Notebooks.
Dieses Notebook ist im Rahmen der Fortbildungsreihe "Vom Dokument zur Edition" und konkret des Workshops Editionsdaten semantisch anreichern – XML-Parsing und Named Entity Recognition (NER) mit Python im WiSe 2025/26 an der FU Berlin entstanden. Das Notebook thematisiert, wie XML-Dateien mit Python eingelesen sowie der enthaltene Text extrahiert, weiterverarbeitet und ins ursprüngliche XML zurückgeführt werden kann.
- XML-Dateien mit ElementTree einlesen, aktualisieren und exportieren
- pandas DataFrames erstellen und verwenden
- spaCy NER-Modell laden sowie auf XML-Textknoten und plaintext anwenden
- Part-of-Speech-Tagging und Normalisierung mit spaCy
- Sentiment-, Kollokations- und KWIC-Analysen mit NLTK
Beitragende und ihre Rollen anhand der Contributor Role Taxonomy (CRediT) taxonomy
- Sophie Schneider (@BibWiss): Conceptualization, Software/Writing - Original Draft (Teil 1 & 2), Writing - Review & Editing (Teil 3)
- Catherine Anne Seveke (@cati-gitling): Conceptualization, Software/Writing - Original Draft (Teil 3)
Dieses Notebook ist im Rahmen der Fortbildungsreihe "Panorama Text: Maschinelle Erfassung, Verarbeitung und Kontextualisierung von geschriebener Sprache für die Geisteswissenschaften" und konkret des Workshops Einführung in die Grundlagen der natürlichen Sprachverarbeitung mit Python im Sommersemester 2026 an der FU Berlin entstanden.
- Daten einlesen, transformieren und exportieren
- Data Cleaning (Noise & Stopword Removal, Stemming & Lemmatization, Segmentation - Tokenization, Sentence Splitting)
- Feature Extraction (One-hot-Encoding, Bag-of-Words, TF-IDF)
- Semantic Analysis (Named Entity Recognition, Entity Linking, Sentiment Analysis)
- Python 3.14.3
- conda/pip
- Jupyter Notebook
- Python standard library: re, collections, string, random
- NLP: spacy, nltk
- Data Analysis and Transformation, ML: pandas, numpy, sklearn
- Visualization: plotly, wordcloud, matplotlib
- Sophie Schneider (@BibWiss): Conceptualization, Software, Writing - Original Draft