Convertir webarchive a html

Convertir WEBARCHIVE a HTML

Extraer contenido WEBARCHIVE de Safari como HTML editable y compatible con el navegador.

Cree archivos HTML en línea

Todavía no podemos leer archivos WEBARCHIVE, así que esta conversión no está disponible. Si puede exportar su trabajo a alguno de estos formatos u otros, lo convertiremos en HTML:

Cómo convertir un archivo webarchive a html

  • Internet

Un archivo de Safari puede necesitar conversión cuando un editor, un servidor web o un navegador que no sea de Apple requiere un archivo .html normal. Convertirlo también facilita inspeccionar, editar o compartir el documento sin Safari.

Qué es el formato .webarchive

Un archivo .webarchive normalmente es un archivo binario de lista de propiedades de Apple creado por Safari u otra aplicación basada en WebKit. Puede contener el HTML de la página, imágenes, hojas de estilo, scripts, fuentes y metadatos en un solo archivo, lo que permite volver a abrir una copia sin conexión con gran parte de su apariencia original.

Safari crea uno mediante File → Save As cuando se selecciona Web Archive como formato. WEBARCHIVE es un contenedor asociado con Apple, no un formato estándar compatible con todos los navegadores o servidores web.

Qué es el formato .html

HTML es el lenguaje de marcado estándar utilizado para las páginas web. Un archivo .html puede abrirse en navegadores modernos, editarse en un editor de código, publicarse en un servidor web y procesarse con herramientas de indexación o documentos sin Safari.

Normalmente, HTML contiene referencias a archivos independientes de imágenes, CSS, JavaScript y fuentes. Cambiar la extensión o extraer únicamente el recurso principal no crea automáticamente una copia completa sin conexión.

Convertirlo con Safari en macOS

  1. Abra el archivo .webarchive en Safari.
  2. Seleccione File → Save As.
  3. En el menú de formato, elija Page Source o Page Source HTML, según la versión de Safari.
  4. Guarde el archivo con una extensión .html.

Este es el método de escritorio más rápido, pero las versiones de Safari difieren. Algunas instalaciones solo muestran Web Archive en el cuadro de diálogo para guardar; en ese caso, utilice el método de extracción que se indica a continuación. Es posible que el código fuente exportado no incluya todos los subrecursos archivados en un directorio local independiente.

Extraer el recurso principal con Python

La biblioteca estándar de Python puede leer la estructura binaria de lista de propiedades sin instalar un convertidor. Guarde lo siguiente como extract_webarchive.py:

import plistlib
import sys

source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
    archive = plistlib.load(file)

main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
    raise TypeError('WebResourceData is not binary data')

with open(destination, 'wb') as file:
    file.write(data)

Ejecútelo desde Terminal, Command Prompt o PowerShell con Python 3:

python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"

La salida normalmente es el recurso HTML principal del archivo. Compruebe el WebResourceMIMEType del archivo si la salida no es texto legible; el recurso principal también puede ser un PDF, una imagen u otro tipo de archivo.

Conversión en línea y alternativas de escritorio

Safari es adecuado para una conversión puntual en macOS, mientras que el método de Python se puede repetir y funciona en otros sistemas con Python 3. Para un archivo que no contenga información confidencial, se pueden considerar CloudConvert o Zamzar únicamente si la lista de formatos actual del servicio ofrece explícitamente .webarchive como entrada y HTML como salida. Cargar un archivo puede revelar el contenido de sus páginas, datos incrustados, URL o información relacionada con la autenticación, y la compatibilidad en línea con este formato específico de Apple es irregular.

Limitaciones de calidad y compatibilidad

  • El HTML extraído todavía puede hacer referencia al sitio web original, por lo que las imágenes y los estilos pueden desaparecer sin conexión o después de que cambie el sitio.
  • Es posible que JavaScript que dependa de API de Safari, cookies, almacenamiento local, autenticación, solicitudes del servidor o servicios externos no funcione después de la extracción.
  • Una copia completa sin conexión requiere extraer los subrecursos enumerados en la matriz WebSubresources del archivo, escribirlos en un directorio de recursos y reescribir las referencias del HTML. El script simple solo extrae WebMainResource.
  • El recurso principal puede representar el código fuente del documento original en lugar del DOM final producido por JavaScript. Verifique el resultado en un navegador e inspeccione sus enlaces a imágenes, hojas de estilo y scripts.
  • Guardar en HTML cambia el formato del contenedor; no conserva todos los metadatos del archivo de Safari ni garantiza una representación idéntica a nivel de píxel.

WEBARCHIVE vs HTML: comparación de formatos

Cómo se comparan los formatos WEBARCHIVE y HTML en las propiedades que más importan para esta conversión.

Comparación de los formatos de archivo WEBARCHIVE y HTML
Propiedad .WEBARCHIVE Safari Web Archive .HTML HyperText Markup Language
Se abre en un navegador web No Sí, de forma nativa
Legible como texto plano — Sí
Formato de texto Básico Amplio
Imágenes Sí Sí
Elementos interactivos Limitado Sí
Edición posterior Limitado Fácil
Tamaño de archivo típico Grande Pequeño
Estándar abierto No Sí
Introducido 2003 1993
Desarrollador Apple Inc. W3C / WHATWG
Tipo MIME application/x-webarchive text/html

Otras conversiones de archivos .webarchive

Convertir a .html
desde otros formatos

Compartir en redes sociales: