Convertir txt a dic

Convertir TXT a DIC

Formatea una lista de palabras TXT para diccionarios plain-list, Hunspell o DIC específicos de la aplicación.

Convierte archivos TXT en línea

Todavía no tenemos un conversor en línea específico para TXT a DIC, pero puedes convertir archivos TXT en línea a estos y otros formatos:

Cómo convertir un archivo txt a dic

  • Otro

Los correctores ortográficos personalizados, las herramientas de terminología y los motores de diccionario suelen aceptar vocabulario únicamente en un diseño .dic específico. Por lo tanto, una lista de palabras mantenida en .txt debe limpiarse y formatearse para que coincida con el programa de destino, en lugar de limitarse a cambiarle el nombre.

Archivos TXT y sus usos

Un archivo .txt es texto sin formato y no tiene una estructura de campos obligatoria. Los editores de texto como Notepad, TextEdit, Notepad++ y VS Code crean archivos TXT; las hojas de cálculo, las bases de datos, los sistemas de terminología y los scripts suelen exportar listas de palabras a estos archivos.

Un archivo de origen puede contener una palabra por línea, términos separados por comas, encabezados, definiciones, duplicados o prosa común. Solo los términos extraídos y validados deben colocarse en un archivo de diccionario.

Archivos DIC y sus variantes

La extensión .dic no identifica un único formato de diccionario universal. Algunas aplicaciones utilizan una lista de palabras UTF-8 con una entrada por línea, mientras que otras usan diccionarios compatibles con Hunspell, diseños de texto propietarios o archivos binarios.

Un archivo .dic de Hunspell normalmente contiene un recuento de palabras en su primera línea, seguido de entradas como colour/AB. Las marcas opcionales se definen mediante un archivo .aff coincidente, que especifica la codificación, las reglas de afijos, las reglas de palabras compuestas y el significado de las marcas. Un archivo DIC sin el archivo AFF correcto no puede añadir reglas de flexión válidas por sí solo.

Un archivo DIC con el formato correcto permite que el software de destino reconozca nombres aprobados, términos técnicos, abreviaturas y variantes ortográficas. Los diccionarios de listas simples son compactos y fáciles de editar, pero reconocen únicamente las entradas literales proporcionadas, a menos que la aplicación admita sus propias reglas morfológicas.

Preparar la lista de origen

  1. Consulta la documentación del programa de destino e inspecciona un archivo de diccionario conocido que funcione en VS Code o Notepad++. Registra su nombre de archivo, codificación, primeras líneas, archivos complementarios necesarios y sintaxis de las entradas.
  2. Abre el origen TXT y elimina los encabezados, las definiciones, las líneas vacías, las entradas compuestas únicamente por puntuación y los términos que el corrector ortográfico no deba aceptar.
  3. Coloca una entrada aceptada en cada línea. Conserva las frases únicamente cuando el formato de diccionario de la aplicación de destino admita entradas de varias palabras.
  4. Elige una política de mayúsculas y minúsculas antes de eliminar los duplicados. Los nombres de productos y las abreviaturas pueden requerir entradas independientes para Acme, ACME y acme.
  5. Guarda el origen limpio como UTF-8, a menos que el diccionario de destino requiera explícitamente otra codificación.

Crear el formato DIC necesario

Para una aplicación que documente un formato DIC de lista simple de palabras, guarda la lista limpia con el nombre de archivo .dic requerido mediante File → Save As. Cambiar la extensión solo es válido cuando la aplicación trata explícitamente su archivo DIC como una lista de texto sin formato.

Para un destino Hunspell, copia la sintaxis de su diccionario existente y utiliza su archivo .aff correspondiente. Coloca el recuento de entradas requerido en la primera línea si el diccionario de muestra del destino lo hace; el recuento no incluye la línea del recuento. Añade marcas únicamente cuando estén definidas en ese archivo AFF. Las marcas arbitrarias no crean plurales, formas verbales ni palabras compuestas.

En PowerShell 7, este comando recorta un origen UTF-8 con un término por línea, elimina las líneas duplicadas exactas, añade un recuento al estilo Hunspell y escribe UTF-8 sin una marca de orden de bytes:

$w = Get-Content words.txt | ForEach-Object { $_.Trim() } | Where-Object { $_ } | Sort-Object -CaseSensitive -Unique; @($w.Count) + $w | Set-Content -Encoding utf8NoBOM custom.dic

Usa el comando únicamente después de confirmar que el destino acepta una lista Hunspell sin marcas y que custom.dic está instalado o registrado con el archivo .aff correspondiente. Para exportaciones de hojas de cálculo o importaciones repetibles, un script de PowerShell o Python es más seguro que la edición manual, porque el filtrado, la gestión de duplicados y los recuentos de entradas siguen siendo reproducibles.

Herramientas y comprobaciones de compatibilidad

VS Code y Notepad++ son adecuados para inspeccionar la codificación, los finales de línea y la sintaxis de diccionarios de muestra. PyGlossary puede convertir formatos de diccionario compatibles, pero no es una solución general para archivos TXT arbitrarios o variantes DIC propietarias; verifica que los plugins de entrada y salida seleccionados coincidan con el formato de destino exacto.

Ningún convertidor genérico en línea puede inferir de forma fiable un dialecto DIC. Evita los servicios que prometen una conversión universal de TXT a DIC, especialmente para nombres de clientes, terminología interna u otro vocabulario confidencial. Utiliza un servicio de procesamiento de texto en línea únicamente cuando su sintaxis de salida y su codificación puedan verificarse con la documentación de la aplicación de destino.

Haz coincidir exactamente la codificación del destino. Los archivos AFF de Hunspell suelen contener SET UTF-8; UTF-16, Windows-1252 o una marca de orden de bytes no compatible pueden dañar los caracteres acentuados o hacer que falle la primera entrada.

Prueba el diccionario instalado con una palabra normal, una palabra acentuada, un término en mayúsculas y una entrada personalizada. Si la carga falla, compara el nombre de archivo, la primera línea, la codificación, los finales de línea, la ubicación de instalación y los archivos complementarios necesarios con un diccionario conocido que funcione.