curl.md : comment convertir n’importe quel site web en Markdown directement depuis le terminal

Extraire le contenu propre d’une page web depuis un terminal ou un script shell tourne vite au casse-tête. Entre les balises publicitaires, les menus de navigation, les scripts JavaScript et les blocs de style CSS, parser du HTML brut avec des outils basiques produit souvent un texte illisible. Le service curl.md règle ce problème en transformant n’importe quelle URL en document Markdown structuré via une simple requête HTTP, sans nécessiter d’installation locale ni de configuration lourde.

Le principe : un scraper web sans fioritures via cURL

L’outil fonctionne comme un proxy de rendu. Vous envoyez une requête avec votre utilitaire de transfert habituel (curl) vers le domaine curl.md, suivi de l’adresse de la page que vous souhaitez lire. Le service télécharge la page distante, supprime le bruit visuel (en-têtes, bandeaux de cookies, pieds de page), isole le corps principal du texte et le reformate en Markdown standard.

La commande s’exécute ainsi :

curl https://curl.md/https://www.techcroute.com/veeam-agent-windows-faille-droits-system

Le retour dans la console affiche le titre au format #, les intertitres, le texte d’origine, les listes à puces et les hyperliens intacts. Rien de superflu n’est conservé.

Automatisation et intégration dans des pipelines de données

Le format Markdown brut en sortie simplifie le traitement de texte en ligne de commande. Il devient simple de chaîner curl.md avec d’autres utilitaires Unix :

  • Redirection vers un fichier local : sauvegardez un article pour une lecture hors ligne avec un simple curl [https://curl.md/https://domaine.tld/page](https://curl.md/https://domaine.tld/page) > documentation.md.
  • Filtrage avec grep ou awk : extrayez des données spécifiques sans devoir construire des expressions régulières complexes pour contourner le balisage HTML.
  • Affichage terminal propre : combinez la commande avec un afficheur Markdown CLI comme glow ou mdcat (curl -s [https://curl.md/https://domaine.tld/page](https://curl.md/https://domaine.tld/page) | glow -) pour lire vos flux d’informations directement dans votre session de travail.

Un format d’entrée adapté aux modèles de langage (LLM)

L’intérêt principal de cette conversion réside dans l’alimentation des pipelines d’intelligence artificielle locale ou distante. Les modèles de langage (LLM) facturent leur consommation au volume de jetons (tokens) et traitent mal le bruit des balises HTML non fermées.

Injecter du HTML brut dans un prompt d’API sature inutilement le contexte contextuel avec des métadonnées sans valeur sémantique. En faisant transiter l’URL par curl.md, vous réduisez drastiquement la taille du payload envoyé à votre script d’inférence (Python, n8n ou script Bash). Le modèle reçoit une syntaxe Markdown légère, claire, et conserve la hiérarchie des informations (titres, tableaux, paragraphes) nécessaire pour résumer un texte ou extraire des points techniques.

Limites techniques à prendre en compte

Le service s’appuie sur la récupération du contenu délivré au premier chargement. Si une page web dépend entièrement d’un rendu JavaScript lourd côté client pour afficher ses paragraphes ou si elle est protégée par un challenge anti-bot agressif (de type Cloudflare Turnstile ou reCAPTCHA), le résultat peut s’avérer tronqué ou renvoyer un code d’erreur HTTP. De même, les pages protégées par une authentification par session ou un paywall ne sont pas accessibles via ce proxy public.

Pour le reste des blogs techniques, documentations logicielles et sites d’actualité, la solution évite de sortir l’artillerie lourde (navigateurs sans tête type Playwright ou Puppeteer) lorsqu’une simple lecture textuelle suffit.

- Publicité -