229,676 packages matching “html-extraction”
@kontourai/traverse
v0.25.1 · 12 days ago
Schema-directed content extraction that produces provenance-bearing, review-ready extraction proposals in Survey's shape.
No known vulnerabilities
@signalwire/docusaurus-plugin-llms-txt
v1.2.2 · 1 year ago
Generate Markdown versions of Docusaurus HTML pages and an llms.txt index file
No known vulnerabilities
@tokenizer/inflate
v0.4.1 · 8 months ago
Tokenized zip support
No known vulnerabilities
@flatfile/util-extractor
v2.8.0 · 9 months ago
A library containing common utilities and helpers for extractors.
No known vulnerabilities
@biesbjerg/ngx-translate-extract-marker
v1.0.0 · 7 years ago
Function to manually mark strings to be extracted using ngx-translate-extract
No known vulnerabilities
api2pdf
v2.1.0 · 5 months ago
Node.js client for the Api2Pdf REST API with support for Chrome, wkhtmltopdf, LibreOffice, Markitdown, OpenDataLoader, PdfSharp, Zip, Zebra, and utility endpoints.
No known vulnerabilities
dom-to-semantic-markdown
v1.5.0 · 1 year ago
DOM to Semantic-Markdown for use in LLMs
No known vulnerabilities
i18next-cli
v1.67.9 · 20 hours ago
A unified, high-performance i18next CLI.
No known vulnerabilities
twitter-text
v3.1.0 · 6 years ago
official twitter text linkification
No known vulnerabilities
@opendataloader/pdf
v2.5.0 · 26 days ago
A Node.js wrapper for the opendataloader-pdf Java CLI.
No known vulnerabilities
@wix/error-handler
v1.68.0 · 3 months ago
This package provides a simple error handling mechanism for your application.
No known vulnerabilities
mp4box
v2.4.1 · 1 month ago
JavaScript version of GPAC's MP4Box tool
No known vulnerabilities
@alexcdot/textract
v2.5.3 · 2 years ago
Extracting text from files of various type including html, pdf, doc, docx, xls, xlsx, csv, pptx, png, jpg, gif, rtf, text/*, and various open office.
No known vulnerabilities
@joplin/onenote-converter
v3.6.3 · 3 months ago
Used to import a OneNote archive into Joplin
No known vulnerabilities
pdf2html
v4.4.0 · 1 year ago
PDF to HTML or Text conversion using Apache Tika. Also generate PDF thumbnail using Apache PDFBox.
No known vulnerabilities
pi-web-access
v0.19.0 · 1 day ago
Web search, URL fetching, GitHub repo cloning, PDF extraction, YouTube video understanding, and local video analysis for Pi coding agent. Supports OpenAI, Brave, Parallel, TinyFish, Search1API, Searchinfinity, Querit, Tavily, Jina, SERPdive, Kagi, Ollama,
No known vulnerabilities
@agent-infra/browser-context
v0.2.2 · 6 months ago
get browser context for AI Agent
No known vulnerabilities
@symbiotejs/symbiote
v3.8.2 · 1 month ago
Symbiote.js - zero-dependency close-to-platform frontend library to build super-powered web components
No known vulnerabilities
@plurnk/plurnk-mimetypes-text-html
v1.4.0 · 3 days ago
text/html and application/xhtml+xml mimetype handler for plurnk-service. Structural extraction via parse5; readable markdown (content channel) via Readability + turndown.
No known vulnerabilities
playwright-mcp-advanced
v0.1.0 · 1 year ago
Advanced Playwright Tools for MCP
No known vulnerabilities