Convertir WEBARCHIVE a HTML
Extraer contenido WEBARCHIVE de Safari como HTML editable y compatible con el navegador.
Cree archivos HTML en línea
Todavía no podemos leer archivos WEBARCHIVE, así que esta conversión no está disponible. Si puede exportar su trabajo a alguno de estos formatos u otros, lo convertiremos en HTML:
Cómo convertir un archivo webarchive a html
- Internet
- Aún sin calificaciones.
Un archivo de Safari puede necesitar conversión cuando un editor, un servidor web o un navegador que no sea de Apple requiere un archivo .html normal. Convertirlo también facilita inspeccionar, editar o compartir el documento sin Safari.
Qué es el formato .webarchive
Un archivo .webarchive normalmente es un archivo binario de lista de propiedades de Apple creado por Safari u otra aplicación basada en WebKit. Puede contener el HTML de la página, imágenes, hojas de estilo, scripts, fuentes y metadatos en un solo archivo, lo que permite volver a abrir una copia sin conexión con gran parte de su apariencia original.
Safari crea uno mediante File → Save As cuando se selecciona Web Archive como formato. WEBARCHIVE es un contenedor asociado con Apple, no un formato estándar compatible con todos los navegadores o servidores web.
Qué es el formato .html
HTML es el lenguaje de marcado estándar utilizado para las páginas web. Un archivo .html puede abrirse en navegadores modernos, editarse en un editor de código, publicarse en un servidor web y procesarse con herramientas de indexación o documentos sin Safari.
Normalmente, HTML contiene referencias a archivos independientes de imágenes, CSS, JavaScript y fuentes. Cambiar la extensión o extraer únicamente el recurso principal no crea automáticamente una copia completa sin conexión.
Convertirlo con Safari en macOS
- Abra el archivo
.webarchiveen Safari. - Seleccione File → Save As.
- En el menú de formato, elija Page Source o Page Source HTML, según la versión de Safari.
- Guarde el archivo con una extensión
.html.
Este es el método de escritorio más rápido, pero las versiones de Safari difieren. Algunas instalaciones solo muestran Web Archive en el cuadro de diálogo para guardar; en ese caso, utilice el método de extracción que se indica a continuación. Es posible que el código fuente exportado no incluya todos los subrecursos archivados en un directorio local independiente.
Extraer el recurso principal con Python
La biblioteca estándar de Python puede leer la estructura binaria de lista de propiedades sin instalar un convertidor. Guarde lo siguiente como extract_webarchive.py:
import plistlib
import sys
source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
archive = plistlib.load(file)
main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
raise TypeError('WebResourceData is not binary data')
with open(destination, 'wb') as file:
file.write(data)
Ejecútelo desde Terminal, Command Prompt o PowerShell con Python 3:
python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"
La salida normalmente es el recurso HTML principal del archivo. Compruebe el WebResourceMIMEType del archivo si la salida no es texto legible; el recurso principal también puede ser un PDF, una imagen u otro tipo de archivo.
Conversión en línea y alternativas de escritorio
Safari es adecuado para una conversión puntual en macOS, mientras que el método de Python se puede repetir y funciona en otros sistemas con Python 3. Para un archivo que no contenga información confidencial, se pueden considerar CloudConvert o Zamzar únicamente si la lista de formatos actual del servicio ofrece explícitamente .webarchive como entrada y HTML como salida. Cargar un archivo puede revelar el contenido de sus páginas, datos incrustados, URL o información relacionada con la autenticación, y la compatibilidad en línea con este formato específico de Apple es irregular.
Limitaciones de calidad y compatibilidad
- El HTML extraído todavía puede hacer referencia al sitio web original, por lo que las imágenes y los estilos pueden desaparecer sin conexión o después de que cambie el sitio.
- Es posible que JavaScript que dependa de API de Safari, cookies, almacenamiento local, autenticación, solicitudes del servidor o servicios externos no funcione después de la extracción.
- Una copia completa sin conexión requiere extraer los subrecursos enumerados en la matriz
WebSubresourcesdel archivo, escribirlos en un directorio de recursos y reescribir las referencias del HTML. El script simple solo extraeWebMainResource. - El recurso principal puede representar el código fuente del documento original en lugar del DOM final producido por JavaScript. Verifique el resultado en un navegador e inspeccione sus enlaces a imágenes, hojas de estilo y scripts.
- Guardar en HTML cambia el formato del contenedor; no conserva todos los metadatos del archivo de Safari ni garantiza una representación idéntica a nivel de píxel.
WEBARCHIVE vs HTML: comparación de formatos
Cómo se comparan los formatos WEBARCHIVE y HTML en las propiedades que más importan para esta conversión.
| Propiedad | .WEBARCHIVE Safari Web Archive | .HTML HyperText Markup Language |
|---|---|---|
| Se abre en un navegador web | No | Sí, de forma nativa |
| Legible como texto plano | — | Sí |
| Formato de texto | Básico | Amplio |
| Imágenes | Sí | Sí |
| Elementos interactivos | Limitado | Sí |
| Edición posterior | Limitado | Fácil |
| Tamaño de archivo típico | Grande | Pequeño |
| Estándar abierto | No | Sí |
| Introducido | 2003 | 1993 |
| Desarrollador | Apple Inc. | W3C / WHATWG |
| Tipo MIME | application/x-webarchive | text/html |