Convertisseur HTML vers Markdown - Du Markdown propre depuis n’importe quelle page
Convertir du HTML en Markdown
Scripts, styles et médias intégrés sont supprimés ; les balises inconnues gardent leur texte. Les tableaux deviennent des tableaux GFM.
Transformer du HTML en Markdown
Transférer un billet de blog dans un README, une page de documentation dans un wiki ou un article web dans vos notes, c’est se débarrasser du HTML sans perdre la structure. Ce convertisseur analyse le balisage comme un navigateur et écrit le Markdown équivalent — les titres restent des titres, les listes imbriquées restent imbriquées, les tableaux restent des tableaux — tandis que scripts, styles et pixels de suivi disparaissent.
Étapes
- 1 Collez le HTML — une page entière ou un fragment — dans la zone du haut. Dans la plupart des navigateurs, un clic droit puis Afficher le code source permet de le copier.
- 2 Lisez le Markdown en dessous ; il se met à jour au fil de la frappe. Listes imbriquées, blocs de code avec langage et tableaux alignés sont préservés.
- 3 Copiez le résultat ou téléchargez-le en fichier .md.
Qu’est-ce qui devient quoi
Les titres h1 à h6 deviennent des titres à dièses ; p devient un paragraphe, br un saut de ligne forcé et hr un filet. strong et b deviennent des doubles astérisques, em et i des astérisques simples, del et s des doubles tildes ; code devient des accents graves et pre un bloc clôturé qui garde une classe de langage comme étiquette. Les liens deviennent [texte](url), les images  ; ul et ol deviennent des listes à tirets et numérotées imbriquées par deux espaces ; blockquote devient des lignes préfixées d’un chevron ; table devient un tableau GFM dont l’alignement vient des attributs align ou des styles text-align.
Pourquoi il travaille sur le DOM, pas sur le texte
Les expressions régulières ne peuvent pas traiter le HTML de façon fiable : les balises s’imbriquent, les attributs contiennent des chevrons dans des chaînes, et les vraies pages sont rarement bien formées. Le convertisseur confie le HTML à l’analyseur du navigateur, qui répare les balises non fermées ou mal imbriquées exactement comme au rendu, puis parcourt l’arbre obtenu. C’est pourquoi un lien dans du gras dans un élément de liste ressort correctement.
Ce qui est supprimé et ce qui est gardé
script, style, head, noscript, template, iframe, object, embed, svg, canvas, video et audio sont retirés avec leur contenu — aucun n’a d’équivalent Markdown et la plupart ne sont que du bruit. Tout le reste non reconnu garde son texte : un élément personnalisé, un span ou un div est traité comme un conteneur et ses enfants sont convertis. La mise en forme en ligne à l’intérieur de balises inconnues survit donc.
Échappement et sortie propre
Les caractères qui changeraient de sens en Markdown — astérisques, tirets bas, accents graves, barres obliques inverses, et dièse ou tiret en début de ligne — sont échappés dans le texte afin que la reconversion en HTML donne le même résultat. Les espaces sont réduits comme le ferait un navigateur, sauf dans pre. Les lignes vides sont ramenées à une seule entre les blocs.