Konwerter Document-to-Markdown z serwerem MCP i dwukierunkowym eksportem
all2md, opracowane przez Thomasa Villaniego, konwertuje złożone formaty dokumentów na strukturalny Markdown do przetwarzania przez LLM i zautomatyzowanych przepływów pracy dokumentów. Narzędzie wykonuje dwukierunkową konwersję w ponad 40 formatach, uruchamia wbudowany serwer Model Context Protocol i oferuje chunking natywny dla RAG oraz transformacje oparte na AST dla wysokiej wierności analizy. Zawiera zaawansowane odzyskiwanie tabel PDF, opcjonalne wsparcie OCR oraz narzędzia wsadowe CLI. Docelowi użytkownicy to budowniczowie LLM i RAG, programiści Pythona oraz zaawansowani użytkownicy zajmujący się programatycznym przygotowaniem dokumentów.
Przekształca złożone pliki na Markdown gotowy do LLM do przetwarzania RAG
Narzędzie konwertuje ponad 40 typów plików, w tym PDF, DOCX, PPTX, HTML, e-maile i arkusze kalkulacyjne, na czysty Markdown w stylu GitHub, zaprojektowany do wchłaniania kontekstu modelu. Pipeline używa drzewa składni abstrakcyjnej, aby zachować strukturę dokumentu i umożliwić programowe przekształcenia, a także może zapisywać Markdown z powrotem do bogatych formatów, takich jak DOCX i PDF, co umożliwia edytowanie treści generowanej przez model w obie strony.
Produkuje strukturalne wyjścia z mierzalną wiernością dla złożonych układów
Obsługa PDF koncentruje się na odzyskiwaniu tabel, analizie układów wielokolumnowych oraz usuwaniu nagłówków/stopki, co zmniejsza ilość fałszywego lub 'wymyślonego' tekstu w porównaniu z prostszymi parserami. Projekt raportuje benchmarking w porównaniu do Docling i pymupdf4llm i podkreśla niskie wskaźniki tekstu wymyślonego. Chunking natywny dla RAG dostarcza jedenaście strategii, w tym podziały semantyczne, nagłówkowe i tokenowe, zachowując jednocześnie pochodzenie sekcji i stron dla przepływów pracy związanych z wyszukiwaniem.
Wymaga znajomości programisty, ale zapewnia rozszerzalne, specyficzne dla formatu instalacje
Narzędzie jest dostępne jako biblioteka Pythona i CLI dla PC, macOS i Linux, i celuje w środowiska Python 3.x. Instalator używa modularnego systemu zależności, więc tylko kodeki potrzebne do konkretnych formatów są instalowane, a dodatkowe OCR, takie jak Tesseract lub EasyOCR, są opcjonalne dla zeskanowanych PDF. API wtyczek i przekształcenia AST pozwalają programistom dodawać niestandardowe formaty lub dostosowywać zachowanie parsowania programowo.
Pasuje do pipeline'ów asystentów AI za pomocą MCP i narzędzi wsadowych
Wbudowany serwer Model Context Protocol łączy pipeline konwersji bezpośrednio z asystentami AI, a projekt dostarcza pakiet MCPB do jednego kliknięcia dla klientów takich jak Claude Desktop. Narzędzia wiersza poleceń wspierają monitorowanie katalogów, konwersję wsadową, wyszukiwanie semantyczne i porównywanie dokumentów, aby zautomatyzować wchłanianie. Te integracje pomagają wprowadzać strukturalny Markdown do systemów wyszukiwania i pozwalają programistom włączyć przekonwertowaną treść do dalszych podpowiedzi modelu lub magazynów RAG.
Praktyczny wybór dla deweloperów budujących rurociągi do wprowadzania modeli
Dla zespołów, które konstruują warstwy wyszukiwania i kontekstu, narzędzie zapewnia mierzalną kontrolę nad wiernością źródła i pochodzeniem; jego modułowy, kodowy projekt pasuje do skryptowanych rurociągów i operacji wsadowych. Użytkownicy nietechniczni prawdopodobnie napotkają strome krzywe ustawień. Praktyczna rada: wyjście w GitHub Flavored Markdown i preferowanie chunkowania opartego na semantyce lub nagłówkach, aby zachować pochodzenie podczas importowania dokumentów do magazynów kontekstu modeli. Włącz dodatkowe OCR dla obrazowych plików PDF przed uruchomieniami wsadowymi.





