API keys are…
OAuth is…
| Methode | Verwendung |
|---|---|
| Keys | Server |
| OAuth | Apps |
PDF → Markdown
PDFs sind zum Lesen und Teilen gemacht, nicht zum Bearbeiten, Durchsuchen oder für RAG. Wir konvertieren PDF zu Markdown mit Überschriften, Tabellen, Listen und Gliederung — bereit für Docs, Retrieval und KI.
Extrahieren Sie den Text und das Dokument: Überschriften, Tabellen, Listen, Links und Hierarchie — kein Haufen unstrukturierter Zeichen.
100 % lokal in Ihrem Browser — Dateien verlassen Ihr Gerät nie. Bis zu 50 MB. Probieren Sie eine Beispiel-PDF im Konverter.
Im Browser konvertieren
Kein Upload. Überschriften, Tabellen, Listen und Gliederung bleiben erhalten — dann kopieren oder herunterladen.
PDF hier ablegen, oder
klicken zum DurchsuchenDas Problem
PDF (Portable Document Format) wurde entwickelt, um elektronische Dokumente zu speichern und auszutauschen, sodass sie auf jedem Gerät und in jeder App gleich aussehen. Das ist ein Vorteil bei Verträgen, Berichten oder gedruckten Handbüchern. Es ist ein Problem, wenn Sie den Inhalt brauchen.
Ein PDF speichert „wie dieses Dokument aussehen soll“, nicht „woraus dieses Dokument besteht“.
| Merkmal | Was es in der Praxis bedeutet |
|---|---|
| Festes Layout | Schriften, Bilder, Tabellen, Abstände, Kopf- und Fußzeilen bleiben fix. Die Seite fließt nicht um, wenn Sie das Gerät wechseln. |
| Plattformübergreifend | Windows, macOS, Linux, iOS und Android können es öffnen. |
| Druckfertig | Seitengröße und Drucklayout bleiben erhalten — deshalb erscheinen Verträge, Berichte, Papers und Handbücher als PDF. |
| Stabile Verteilung | Einmal erstellt, dient es als finale Version: lesen, teilen, archivieren. |
| Komplexer Inhalt | Eine PDF ist selten „nur Text“. Sie kann Bilder, Tabellen, Links, Vektorgrafiken, eingebettete Schriften und gescannte Seiten enthalten. |
| Merkmal | Warum es moderne Workflows erschwert |
|---|---|
| Struktur-unfreundlich | PDF kümmert sich um die Seite, nicht um die Gliederung. Maschinen haben Mühe, Überschriften, Absätze, Listen und Tabellen wiederherzustellen. |
| Umständlich zu bearbeiten | Anders als Word oder Markdown ist PDF nicht für häufiges Umschreiben oder Umstrukturieren gemacht. |
| Schwer zu parsen | Eingebettete Schriften, mehrspaltige Layouts, Tabellen, Bilder und Fußnoten erschweren die Extraktion. |
| Manchmal kein Text | Viele PDFs sind Scans — Bilder von Seiten. Sie brauchen OCR, bevor Sie überhaupt an die Wörter kommen. |
Auf der Seite kann eine PDF wie ein Kapitel, ein Abschnitt, eine Liste oder eine Tabelle aussehen.
Kapitel 1 Einleitung Dies ist die Einleitung... 1. Hintergrund 2. Methodik 3. Ergebnisse [Tabelle]
Ein Programm sieht oft etwas anderes: Zeichenketten, Koordinaten, Schriften und Bilder verstreut auf einer Leinwand. Die Wiederherstellung des echten Titels, der Absatzgrenzen, der Liste und der Tabelle ist nicht garantiert.
Eine PDF direkt in eine Wissensbasis zu werfen ist oft der falsche erste Schritt. Das Modell bekommt vielleicht Text. Es bekommt keine Struktur.
Das Ziel
Markdown ist eine leichtgewichtige Auszeichnungssprache. Wenige Klartext-Symbole stehen für Überschriften, Absätze, Listen, Tabellen, Links und Code. Sie können den Quelltext ohne Rendering lesen.
# Produktdokumentation ## Einleitung Markdown ist einfach und leicht lesbar. - Einfach zu bearbeiten - Einfach zu durchsuchen - Einfach zu konvertieren
#, ##, - und ähnliche Marker geben Überschriften und Listen direkt an.
Es ist eine Textdatei. Sie sind nicht in einem Layout-Format gefangen.
Jeder Texteditor funktioniert. Keine spezielle Office-Suite nötig.
Sogar die Rohdatei ist lesbar.
In der Regel viel leichter als PDF oder Word.
Strukturierter Text lässt sich einfach volltextdurchsuchen.
Markdown wird zu HTML, PDF, Word und mehr.
Überschriften, Absätze und Listen sind explizit, sodass Software sie parsen kann.
Klartext gehört in Git.
Windows, macOS, Linux — alle.
Strukturierter Text ist für LLMs, Embeddings und RAG leichter gut nutzbar.
Markdown trennt Inhalt von visuellem Layout.
PDF fragt: Wie soll das auf der Seite aussehen?
Markdown fragt: Was ist das, und wie ist es strukturiert?
Das ist kein kosmetischer Unterschied. Es ist ein Arbeitsunterschied.
# Produktdokumentation ## Installation ### Anforderungen - Node 18+ - Ein gültiger API-Schlüssel
Auf dieser Hierarchie basieren moderne Content-Workflows.
Produktdokumentation
└── Installation
└── Anforderungen
├── Node 18+
└── Ein gültiger API-SchlüsselKI braucht nicht nur „den Text“. Sie braucht die Beziehungen zwischen Textteilen. Für ein KI- oder RAG-System sind Überschriftenebenen, Absatzgrenzen, Listen und Tabellen plötzlich eindeutig.
Deshalb passt Markdown:
Wenn der nächste Schritt Bearbeitung, Retrieval oder Generierung ist, ist Markdown das Format, das bereits nach der Aufgabe aussieht.
Zwei Formate, zwei Aufgaben
PDF speichert, wie ein Dokument aussieht. Markdown speichert, was ein Dokument ist.
| Markdown | ||
|---|---|---|
| Kernzweck | Seite und visuelles Layout bewahren | Inhalt und Struktur ausdrücken |
| Bearbeitbarkeit | ★★ | ★★★★★ |
| Maschinelles Parsen | ★★ | ★★★★★ |
| Suche | ★★★ | ★★★★★ |
| KI-Verarbeitung | ★★ | ★★★★★ |
| RAG | So schlecht geeignet | Natürlich geeignet |
| Versionskontrolle | Umständlich | Nativ |
| Dateigröße | In der Regel größer | In der Regel klein |
| Plattformübergreifend | Ja | Ja |
| Menschenlesbarkeit | Ja | Ja |
| Seitenlayout | Stark | Schwach |
Sie brauchen PDFs weiterhin. Verträge, Berichte und Papers müssen für jeden Leser gleich aussehen. Sie brauchen Markdown, wenn dasselbe Material wiederverwendet, abgefragt, aktualisiert oder an ein Modell übergeben werden soll.
Die Formate sind keine Gegner. Sie haben verschiedene Aufgaben. Das fehlende Stück ist die Konvertierung dazwischen.
Das Produkt
Das wichtigste Material liegt bereits als PDF vor. Die nächste Arbeit nicht: umschreiben, durchsuchen, abrufen, zusammenfassen, veröffentlichen. Diese Arbeit braucht Struktur.
Sie kaufen nicht „Text aus einer PDF“. Sie kaufen ein Dokument, das der Rest Ihres Stacks nutzen kann.
Wandeln Sie Ihre PDFs in sauberes, strukturiertes Markdown um — bereit für Bearbeitung, Suche, KI, RAG und mehr.
PDF konvertierenDas richtige Format wählen
Denken Sie an eine Kette, nicht an eine Wahl: PDF ist für Auslieferung und Lesen → Markdown ist für Bearbeitung und Verarbeitung → PDF zu Markdown macht bestehende PDFs zu strukturiertem Inhalt, mit dem Sie wirklich arbeiten können.
PDF ist am besten, wenn Inhalt gezeigt, geteilt, gedruckt oder ohne Abweichung archiviert werden soll.
PDFs Aufgabe in einer Zeile: Was sie sehen, soll dem entsprechen, was ich gemacht habe.
| Verwendung | Warum PDF |
|---|---|
| Verträge | Layout bleibt für beide Parteien und das Archiv fix. |
| Berichte | Diagramme, Text und Seitenlayout bleiben konsistent. |
| Papers / Forschung | Formelles Publizieren und Lesen. |
| E-Books | Kapitel, Abbildungen und Seitengestaltung bleiben erhalten. |
| Produkthandbücher | Nutzer können herunterladen, lesen oder drucken. |
| Rechnungen / Belege | Das Formular bleibt unverändert. |
| Unternehmensdokumente | Formelle Verteilung. |
| Kursmaterialien | Vorlesungen und Lehrbücher als eine Datei. |
| Druck | Seitengeometrie überlebt den Drucker. |
| Archive | Eine stabile finale Version. |
Markdown ist am besten, wenn Sie es noch bearbeiten, aktualisieren, durchsuchen, konvertieren oder Software darauf zugreifen lassen müssen.
Markdowns Aufgabe in einer Zeile: Inhalt einfach bearbeitbar, verwaltbar, durchsuchbar und parsebar machen.
| Verwendung | Warum Markdown |
|---|---|
| Technische Docs | Entwickler können es direkt bearbeiten. |
| Wissensbasen | Struktur ist klar; Organisation ist einfach. |
| Blogs / Schreiben | Schnell zu schreiben; leicht in eine Seite zu verwandeln. |
| Produktdokumentation | Kapitel, Abschnitte und Codeblöcke sind first-class. |
| KI-Wissensbasen | Modelle verarbeiten strukturierten Text zuverlässiger. |
| Suche | Klartext ist leichter zu indexieren. |
| RAG | Saubereres Chunking, Embedding und Retrieval. |
| Git / GitHub | Klartext ist wofür Versionskontrolle da ist. |
| Projekt-READMEs | Nativ auf GitHub und ähnlichen Plattformen. |
| Content-Konvertierung | Eine Quelle → HTML, PDF und andere Ausgaben. |
Realität: Eine riesige Menge wichtigen Materials ist bereits PDF. Dann müssen Sie:
Das ist die Konvertierung. PDF → Markdown.
So funktioniert es
Ein Bericht, Handbuch, Paper, Handbuch, SOP oder Archiv-PDF — einschließlich Dateien mit Text, Tabellen, Bildern und Links.
Wir stellen mehr als einen Text-Dump wieder her: Überschriften, Listen, Tabellen, Links und Lesereihenfolge, sodass das Markdown noch eine Dokumentform hat.
Bearbeiten. Durchsuchen. Chunken. Embedden. Veröffentlichen. An LLM übergeben. In Git legen.
Anwendungsfälle
Ein Unternehmen hat bereits tausend PDFs: Produkthandbücher, technische Dokumentation, interne SOPs, Verträge, Forschungsberichte, Schulungsmaterialien. Das Ziel ist ein Assistent, der aus diesen Dateien antwortet. PDFs in die Pipeline zu werfen ist meist nicht der beste erste Schritt.
Der Stapel, den Sie bereits haben
Die Pipeline, die funktioniert
PDF → strukturiertes Markdown → Chunking → Embedding → Vektordatenbank → RAG → KI-Assistent
PDF zu Markdown ist der Data-Prep-Schritt für eine KI-Wissensbasis. Ohne Struktur schneidet Chunking an falschen Stellen, Embeddings mischen unrelated Abschnitte, und Retrieval liefert Blobs statt Antworten. Mit Markdown ist eine Überschrift eine Überschrift, eine Tabelle eine Tabelle, und ein Abschnitt kann als Abschnitt abgerufen werden.
Sie haben eine 100-seitige Datei: 2026 Global Market Research Report. Sie möchten, dass ChatGPT, Claude oder Gemini den Bericht zusammenfasst, Kennzahlen extrahiert, Wettbewerber analysiert, Markttrends findet und Fragen aus dem Dokument beantwortet.
Was das Modell tun soll
Nach der Konvertierung kann das Modell der Gliederung folgen statt zu raten. Das ist der Unterschied zwischen „eine Textwand einfügen“ und „dem Modell ein Dokument geben“.
# Executive Summary ## Market Overview ... ## Market Size ... ## Competitive Landscape ### Company A ... ### Company B ...
Forscher leben in PDFs. Sobald sie Markdown sind, können Sie den Volltext durchsuchen, Abschnitte extrahieren, eine Forschungsbibliothek organisieren, eine Literatur-Wissensbasis aufbauen, mit KI zusammenfassen, RAG über den Korpus laufen lassen und Papers vergleichen.
Research Paper 1.pdf Research Paper 2.pdf Research Paper 3.pdf Research Paper 4.pdf …
PDF
→ Markdown
→ Forschungs-Wissensbasis
→ KI
→ „Vergleiche, was diese 50 Papers
über RAG schlussfolgern.“Die Papers bleiben als PDFs zitierbar. Die Arbeitskopie wird etwas, das Sie abfragen können.
Viel bestehendes technisches Material erscheint noch als PDF. Teams wollen lebendige Dateien — dann gehören sie in GitHub, GitLab, Notion, eine Dokumentations-Website oder eine interne Wissensbasis.
Von gesperrten Handbüchern
Zu Dateien, die Sie pflegen können
Wartung wird günstiger: Diffs, Reviews, Suche und Republishing funktionieren wie Software es bereits tut.
Ein Produkthandbuch, das früher ein Download war, kann eine Site werden. Die PDF ist eine Datei, die Nutzer speichern. Der Markdown-Weg wird Dokumentation, die Nutzer durchsuchen, navigieren und im Web öffnen können.
PDF-Produkthandbuch → Markdown → HTML → Dokumentations-Website
Das Unternehmen hat bereits Company Handbook.pdf. Es sollte nicht in dieser einen Datei gefangen bleiben. Das ist Content-Repurposing: eine Source of Truth, viele Ausgaben — weil die Struktur endlich unabhängig von der Seite existiert.
PDF
→ Markdown
├── Blog-Artikel
├── Website-Inhalt
├── FAQ
├── Wissensbasis
├── KI-Dataset
└── DokumentationVorher / Nachher
Introduction Getting started Install the CLI... 1. Download 2. Configure
# Introduction ## Getting started Install the CLI... 1. Download 2. Configure
Zeilen auf einer Seite. Vielleicht die richtige Reihenfolge. Vielleicht nicht. Überschriftenebene ist geraten. Nach der Konvertierung sind Überschriften, Grenzen und Hierarchie explizit — das ist der Unterschied zwischen Zeichen von einer Seite ziehen und ein Dokument wiederherstellen.
KI-Systeme nutzen diese Hierarchie. Suche nutzt sie. Editoren nutzen sie. Eine PDF reicht sie Ihnen nicht.
Nach der Konvertierung
Behalten Sie die PDF für Menschen. Konvertieren Sie, wenn der nächste Leser ein Editor, ein Suchindex, ein Modell oder eine Site ist.
Lesen / Teilen / Drucken
Schreiben / Strukturieren / Verarbeiten
Extrahieren / Konvertieren / Wiederverwenden
Für wen
Handbücher, SOPs, Verträge und Schulungsdecks in RAG-gestützte Assistenten verwandeln.
Papers und lange Berichte durchsuchen, vergleichen und Fragen stellen.
API-PDFs, Benutzerhandbücher und Handbücher nach Git, Notion oder auf eine Dokumentations-Site verschieben.
Bearbeiten, Tabellen extrahieren, als Website republishen oder eine Datei wiederverwenden, die nie als Arbeitskopie gedacht war.
Wenn die PDF fertig ist, lassen Sie sie als PDF. Wenn die Arbeit nicht fertig ist, konvertieren Sie.
Wonach Nutzer suchen
Diese stehen neben der Hauptanfrage. Jede ist eine Aufgabe, die die Datei überstehen muss — kein weiterer Vortrag über Formate.
Ein gescanntes Handbuch ist ein Stapel Bilder. Es gibt keine Textebene, bis OCR läuft — und OCR allein hinterlässt nur einen Zeichenstrom. Der nützliche Weg ist OCR plus Struktur: Lesereihenfolge, Überschriftenebenen und Tabellen als Tabellen wiederaufgebaut, nicht als Foto eines Rasters. So wird ein Scan zu etwas, das Sie durchsuchen, chunken oder bearbeiten können. Verträge, Rechnungen und ältere Papers sind oft Scans; born-digital Dateien können OCR überspringen, Scans können die Gliederung nicht überspringen. Stempel mit niedrigem Kontrast, schiefe Seiten und gemischte Handschrift scheitern noch und brauchen einen zweiten Blick. Wenn Sie den OCR-Dump unverändert indexieren, speichert eine Wissensbasis Rauschen.
OCR-Konverter öffnenWenn Sie eine PDF unverändert embedden, schneidet der Splitter oft mitten in Tabelle oder Abschnitt, weil er nie eine Überschrift sah. Retrieval liefert dann einen Blob, der related wirkt und es nicht ist. Geben Sie der Pipeline Markdown mit expliziten Überschriften und echten Tabellen, und Chunking kann der Gliederung folgen: ein Abschnitt, eine Tabelle, eine Liste. Embeddings bleiben näher an einem Thema. Das ist der Data-Prep-Job — keine schönere Vorschau. Sie wählen weiterhin Chunk-Größe, Overlap und Vector Store; Konvertierung ersetzt das nicht. Sie verhindert, dass das Modell Kopf- und Fußzeilen sowie Seitenzahlen embeddet, als wären sie die Antwort.
LLM- & RAG-fertiges MarkdownKopieren & Einfügen und naive Extraktoren flachen einen zweispaltigen Bericht zu einem Strom: die Überschrift ist nur größere Schrift, die Tabelle übrig gebliebene Leerzeichen. Downstream können Sie keine Spalte sortieren oder „Abschnitt 4.2“ abrufen. Konvertierung soll Markdown-Überschriften und Pipe-Tabellen ausgeben, mit Lesereihenfolge wie ein Mensch die Seite liest — einschließlich mehrspaltiger Layouts. Fußnoten und Bildunterschriften sollten am zugehörigen Block bleiben. War eine Tabelle ein Screenshot, muss OCR auf dem Bild laufen oder das Raster ist verloren. Der Test ist einfach: Können Sie die Gliederung springen und eine Zeile kopieren?
Tabellen nach Markdown extrahierenSeiten in ChatGPT, Claude oder Gemini einfügen ist für eine einmalige Zusammenfassung okay. Für eine Bibliothek ist es ein schwacher Plan. Das Modell bekommt einen schwach geordneten Blob; Überschriften und Tabellen sind geraten. Sie können die Quelle nicht versionieren, re-chunken oder eine saubere Datei ans Team geben. Zuerst konvertieren, dann prompten: die Gliederung sitzt in der Datei, Zahlen bleiben in Tabellen, und dasselbe Markdown kann zu einem anderen Modell, internem RAG oder Git. Nutzen Sie das Chat-Fenster für Fragen. Nicht als einzigen Extraktor — besonders nicht für einen 100-seitigen Bericht, den Sie nächsten Monat wieder abfragen.
Für ChatGPT & LLMs konvertierenEine Datei ist eine Demo. Operationen sehen wie ein Ordner aus: zweihundert Handbücher, ein Vertragsarchiv, ein Paper-Korpus. Batch-Konvertierung soll Dateinamen behalten, Dateien mit .md überspringen und sichtbar scheitern, wenn ein Scan OCR braucht oder eine Tabelle kollabiert. Output neben das Original — oder in einen parallelen Baum — damit Sie diffen und neu laufen können. Danach kann derselbe Korpus indexiert, embedded oder publiziert werden, ohne dass jemand jede PDF öffnet. Starten Sie mit einer Stichprobe hässlicher Dateien (mehrspaltig, Scans, gemischte Tabellen), bevor Sie den Job auf alles richten.
Batch-Konverter öffnenFAQ
Das geht für einen Durchlauf. Ein 100-seitiger Bericht landet trotzdem als schwach strukturierter Blob: Überschriften, Tabellen und Abschnittsgrenzen sind unzuverlässig. Konvertiertes Markdown macht die Gliederung explizit — Executive Summary, Market Size, Competitive Landscape — damit Zusammenfassung, Extraktion und Q&A etwas zum Festhalten haben. Für eine Wissensbasis ist die Lücke größer: RAG will Chunks mit echten Überschriften, nicht Seitenkoordinaten. Konvertierung läuft weiterhin vollständig in Ihrem Browser; die Datei wird nie zu uns hochgeladen.
Word mischt Layout weiter in die Datei. Klartext wirft die Hierarchie weg. Markdown behält Inhalt und Struktur und lässt das Seitendesign fallen — genau das, was Bearbeitung, Git, Suche, Embeddings und LLMs brauchen.
Text, Überschriften, Tabellen, Listen, Links und Dokumentstruktur. Der Punkt ist kein Raw-Dump. Der Punkt ist eine Datei, die noch eine Gliederung hat. Kopf- und Fußzeilen sowie Seitenzahlen werden automatisch entfernt.
Viele PDFs sind Bilder von Seiten. Die brauchen OCR, bevor Text zu strukturieren ist. Nutzen Sie den integrierten OCR-Konverter, der Text direkt in Ihrem Browser erkennt. Gescannte Eingabe ist ein Grund, warum „einfach die PDF parsen“ in der Praxis scheitert.
Das sind die harten Fälle — und sie sind häufig. Deshalb gibt es einen dedizierten PDF → Markdown-Schritt. Eine Konvertierung, die nur Zeichenketten aneinanderreiht, durcheinanderbringt die Lesereihenfolge und verpasst die Gliederung.
Beides. Ein Bericht, damit Sie ein LLM danach fragen können. Tausend Handbücher, SOPs und Schulungs-PDFs, damit Sie chunken, embedden und abrufen können. Nutzen Sie den Batch-Konverter für Ordner. Das Produkt ist in beiden Fällen der Prep-Schritt — und er bleibt lokal.
Ja, wenn Sie ein stabiles, drucktreues, teilbares Original brauchen. Konvertierung ersetzt PDF nicht für Verträge, Rechnungen oder Archivkopien. Sie eröffnet ein zweites Leben für denselben Inhalt.
Das ist einer der Gründe zu konvertieren. Markdown lässt sich leicht in HTML, PDF, Word, Docs-Sites, FAQs, Blogposts und KI-Datasets verwandeln. Die PDF war ein Download. Das Markdown ist eine Quelle.
Loslegen
PDFs sind großartig zum Lesen und Teilen, aber nicht für moderne Content-Workflows gemacht. Markdown macht Inhalt strukturiert, bearbeitbar, durchsuchbar und KI-freundlich.
Wandeln Sie Ihre PDFs in sauberes, strukturiertes Markdown um — bereit für Bearbeitung, Suche, KI, RAG und mehr.