Un file HTML contiene molti tipi di contenuto: testo visibile del corpo, tag di intestazione, testo di ancoraggio dei link, attributi alt delle immagini, attributi title, meta description, tag Open Graph, dati strutturati JSON-LD ed etichette ARIA. Tutti questi elementi contribuiscono all'esperienza utente e alla visibilità sui motori di ricerca della pagina tradotta e vanno tutti tradotti. Allo stesso tempo, tag HTML, nomi di classe, ID, href e JavaScript inline non devono mai essere alterati.
BeTranslated utilizza un flusso di estrazione basato su parser che individua tutti i nodi di testo e gli attributi traducibili in un file HTML, bloccando al contempo l'intero markup, gli URL, i nomi di classe e il codice. I traduttori lavorano su segmenti di testo puliti e il file HTML consegnato è pronto all'uso immediato, con i corretti attributi lang per la lingua di destinazione.