<?xml version="1.0" encoding="UTF-8"?>
<!DOCTYPE article PUBLIC "-//NLM//DTD JATS (Z39.96) Journal Publishing DTD v1.3 20210610//EN" "https://jats.nlm.nih.gov/publishing/1.3/JATS-journalpublishing1-3.dtd">
<article article-type="research-article" dtd-version="1.3" xml:lang="es" xmlns:mml="http://www.w3.org/1998/Math/MathML" xmlns:xlink="http://www.w3.org/1999/xlink" xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance">
<front>
<journal-meta>
<journal-id journal-id-type="publisher-id">cp</journal-id>
<journal-title-group>
<journal-title>Ciencia Policial</journal-title>
<abbrev-journal-title abbrev-type="publisher">CP</abbrev-journal-title>
</journal-title-group>
<issn pub-type="ppub">2254-0326</issn>
<issn pub-type="epub">1886-5577</issn>
<publisher>
<publisher-name>Ediciones Universidad de Salamanca</publisher-name>
</publisher>
</journal-meta>
<article-meta>
<article-id pub-id-type="publisher-id">32279</article-id>
<article-id pub-id-type="doi">10.14201/cp.32279</article-id>
<article-categories>
<subj-group subj-group-type="heading">
<subject>Art&#x00ED;culos</subject>
</subj-group>
</article-categories>
<title-group>
<article-title>Metodolog&#x00ED;a de prevenci&#x00F3;n del cibercrimen mediante <italic>Web Scraping</italic> y procesamiento del lenguaje natural para la detecci&#x00F3;n de filtraciones de datos en la <italic>Dark Web</italic></article-title>
<trans-title-group>
<trans-title xml:lang="en">Cybercrime Prevention Methodology Using Web Scraping and Natural Language Processing for the Detection of Data Leaks in the Dark Web</trans-title>
</trans-title-group>
</title-group>
<contrib-group>
<contrib contrib-type="author" corresp="yes">
<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-6169-4523</contrib-id>
<name>
<surname>Rico Pach&#x00F3;n</surname>
<given-names>Noelia</given-names>
</name>
<xref ref-type="aff" rid="aff1"><sup>1</sup></xref>
<email>noeliarico@uniovi.es</email>
<aff id="aff1">
<institution content-type="original">Universidad de Oviedo.</institution>
<institution content-type="orgname">Universidad de Oviedo</institution>
</aff>
</contrib>
<contrib contrib-type="author">
<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0002-5189-1128</contrib-id>
<name>
<surname>Gallo-Serpillo</surname>
<given-names>Facundo</given-names>
</name>
<xref ref-type="aff" rid="aff2"><sup>2</sup></xref>
<email>facundodavid.gallo@unir.net</email>
<aff id="aff2">
<institution content-type="original">Universidad Internacional de La Rioja.</institution>
<institution content-type="orgname">Universidad Internacional de La Rioja.</institution>
</aff>
</contrib>
<contrib contrib-type="author">
<contrib-id contrib-id-type="orcid">https://orcid.org/0000-0003-1179-0856</contrib-id>
<name>
<surname>Barroso</surname>
<given-names>Raquel</given-names>
</name>
<xref ref-type="aff" rid="aff3"><sup>3</sup></xref>
<email>rbreyes@ewala.es</email>
<aff id="aff3">
<institution content-type="original">Ewala IT Services.</institution>
<institution content-type="orgname">Ewala IT Services.</institution>
</aff>
</contrib>
</contrib-group>
<pub-date pub-type="epub">
<day>09</day>
<month>10</month>
<year>2025</year>
</pub-date>
<pub-date pub-type="collection">
<year>2025</year>
</pub-date>
    <volume>184</volume>
<fpage>87</fpage>
    <lpage>113</lpage>
<history>
<date date-type="received">
<day>12</day>
<month>03</month>
<year>2025</year>
</date>
<date date-type="accepted">
<day>13</day>
<month>05</month>
<year>2025</year>
</date>
</history>
<permissions>
<copyright-statement>&#x00A9; 2025 Autores/Authors</copyright-statement>
<copyright-year>2025</copyright-year>
<license license-type="open-access" xlink:href="https://creativecommons.org/licenses/by-nc-sa/4.0/" xml:lang="es">
<license-p>Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) https://creativecommons.org/licenses/by-nc-sa/4.0/</license-p>
</license>
</permissions>
<abstract>
<title>Resumen</title>
<p>El presente trabajo describe una metodolog&#x00ED;a basada en la captura y el procesamiento de datos filtrados que han sido puestos a la venta en la <italic>Dark Web</italic>, una zona de internet con una alta prevalencia de contenido criminal. Uno de los principales desaf&#x00ED;os en la recopilaci&#x00F3;n y procesamiento de datos cr&#x00ED;ticos vendidos en la <italic>Dark Web</italic> es la volatilidad del contenido y su falta de estructura. Por esta raz&#x00F3;n, se propone una metodolog&#x00ED;a basada en t&#x00E9;cnicas de <italic>Web Scraping</italic> y procesamiento del lenguaje natural (PNL) para la detecci&#x00F3;n de datos sensibles publicados en el mercado negro de Internet, con el objetivo de prevenir su uso en casos de extorsi&#x00F3;n, robo de identidad, divulgaci&#x00F3;n de secretos y otro tipo de ciberdelitos.</p>
<p>El software desarrollado representa un gran avance para el bienestar social, ya que permite la monitorizaci&#x00F3;n y la interpretaci&#x00F3;n autom&#x00E1;tica de datos filtrados en la <italic>Dark Web</italic> (por ejemplo, tarjetas de cr&#x00E9;dito, n&#x00FA;meros de identificaci&#x00F3;n personal, etc.) salvaguardando, de esta manera, la privacidad de los individuos y los organismos afectados. Adem&#x00E1;s, al proporcionar un enfoque m&#x00E1;s r&#x00E1;pido y preciso para abordar estas amenazas, la adopci&#x00F3;n de la arquitectura propuesta en este trabajo promueve un entorno en l&#x00ED;nea m&#x00E1;s seguro para todos los usuarios.</p>
</abstract>
<trans-abstract xml:lang="en">
<title>Abstract</title>
<p>This paper sets out a methodology for the capture and processing of data that has been leaked and made available for sale on the Dark Web, a part of the internet that is known for its high prevalence of criminal content. A significant challenge in the collection and processing of critical data sold on the Dark Web is the volatility of the content and its lack of structure. To address these challenges, a methodology employing Web Scraping and Natural Language Processing (NLP) techniques is proposed for the detection of sensitive data published on the Internet black market. The aim is to prevent its use in cases of extortion, identity theft, disclosure of secrets and other types of cybercrime.</p>
<p>The developed software represents a significant advancement in terms of social welfare, as it facilitates the automated monitoring and interpretation of data leaked on the Dark Web (e.g. credit card details, personal identification numbers, etc.), thereby ensuring the privacy of the individuals and organisations concerned. Moreover, by offering a more efficient and precise approach to address these threats, the adoption of the architecture proposed in this work contributes to the creation of a safer online environment for all users.</p>
</trans-abstract>
<kwd-group xml:lang="es">
<title>Palabras clave</title>
<kwd>Fuga de datos</kwd>
<kwd>Miner&#x00ED;a de texto</kwd>
<kwd>PNL</kwd>
<kwd>Ciberdelito</kwd>
<kwd><italic>Dark Web</italic></kwd>
</kwd-group>
<kwd-group xml:lang="en">
<title>Keywords</title>
<kwd><italic>Data Leakage</italic></kwd>
<kwd><italic>Text Mining</italic></kwd>
<kwd>NLP</kwd>
<kwd><italic>Cybercrime</italic></kwd>
<kwd><italic>Dark Web</italic></kwd>
</kwd-group>
</article-meta>
</front>
<body>
<sec sec-type="sec-1-32279">
<label>1</label>
<title>Introducci&#x00F3;n</title>
<sec sec-type="sec-2-32279">
<label>1.1</label>
<title>La <italic>Dark Web</italic> como ecosistema para la venta de datos filtrados</title>
<p>La <italic>Dark Web</italic> se ha convertido en un basti&#x00F3;n para la distribuci&#x00F3;n y la venta de contenido il&#x00ED;cito, as&#x00ED; como en un medio que favorece las actividades del crimen organizado (<xref ref-type="bibr" rid="ref-6-32279">Connolly <italic>et al</italic>., 2023</xref>, p. 1). En este sentido, una de las principales arquitecturas que alberga servicios en la <italic>Dark Web</italic> es &#x201C;The Onion Router&#x201D;, m&#x00E1;s conocida como la red TOR. Esta red es un sistema computacional basado en nodos cuya finalidad principal es garantizar el anonimato de los usuarios (<xref ref-type="bibr" rid="ref-12-32279">Lacey y Salmon, 2015</xref>, p. 118). Cuando un usuario emplea TOR, su tr&#x00E1;fico de internet se enruta (se dirige) a trav&#x00E9;s de una serie de servidores operados por voluntarios distribuidos en todo el mundo. Cada nodo solo conoce el nodo que le pas&#x00F3; los datos y el nodo al que se los entregar&#x00E1;, creando capas de cifrado similares a las capas de una cebolla, de ah&#x00ED; su nombre. Esta cadena de nodos dificulta que cualquier persona pueda rastrear el origen real de los datos.</p>
<p>Si bien existen diversas t&#x00E9;cnicas y t&#x00E1;cticas para explorar su contenido de manera din&#x00E1;mica, por ejemplo, el uso de <italic>Crawling</italic> (<xref ref-type="bibr" rid="ref-9-32279">Gede <italic>et al</italic>., 2017</xref>, p. 2), an&#x00E1;lisis de contenido mediante etiquetas HTML (<xref ref-type="bibr" rid="ref-1-32279">Al Nabki <italic>et al</italic>., 2017</xref>, p. 41) o incluso la utilizaci&#x00F3;n de <italic>Honeypots</italic> (<xref ref-type="bibr" rid="ref-8-32279">Gallo-Serpillo y Valls-Prieto, 2024</xref>, p. 2), entre otras, resulta dif&#x00ED;cil estimar el volumen total de contenido ilegal alojado en la red TOR debido a la falta de indexaci&#x00F3;n de los servicios y su naturaleza vol&#x00E1;til; en este contexto, <xref ref-type="bibr" rid="ref-20-32279">Saleem <italic>et al</italic>. (2022</xref>, p. 1) estiman que las p&#x00E1;ginas de acceso com&#x00FA;n (denominadas Web Superficial o <italic>Surface Web</italic>) representan aproximadamente el 4 % de los servicios de internet, mientras que el 96 % restante corresponde a contenido oculto y no indexado presente en la <italic>Dark Web</italic>. Aunque es complicado encontrar estudios actuales que cuantifiquen el contenido criminal en la red TOR, una aproximaci&#x00F3;n volum&#x00E9;trica puede obtenerse a trav&#x00E9;s de su propio servicio estad&#x00ED;stico, el cual revela una recurrencia diaria de m&#x00E1;s de 700 000 servicios ocultos activos, alcanzando su punto m&#x00E1;ximo el 18/01/2024 con 1 233 872 servicios activos (<xref ref-type="fig" rid="fig-1-32279">Imagen 1</xref>).</p>
<fig id="fig-1-32279">
<label>Imagen 1:</label>
<caption><title>Servicios ocultos activos entre 01/2024 y 03/2024</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-1-32279.jpg"/>
<attrib>Fuente: <ext-link ext-link-type="uri" xlink:href="https://metrics.torproject.org">https://metrics.torproject.org</ext-link></attrib>
</fig>
<p>Considerando la gran cantidad de informaci&#x00F3;n y servicios accesibles en internet, la filtraci&#x00F3;n de datos representa un riesgo cr&#x00ED;tico recurrente para todas las organizaciones y los usuarios individuales, ya que puede derivar en delitos como la extorsi&#x00F3;n, la divulgaci&#x00F3;n de secretos o la pr&#x00E1;ctica de <italic>Doxing</italic> (la publicaci&#x00F3;n de datos personales de un individuo sin su consentimiento, lo que se considera una violaci&#x00F3;n de la privacidad) (<xref ref-type="bibr" rid="ref-15-32279">Naskali <italic>et al</italic>., 2024</xref>, p. 101). En cuanto a los factores desencadenantes, las filtraciones de datos ocurren cuando informaci&#x00F3;n confidencial o sensible se expone a individuos o entidades no autorizadas, ya sea de manera intencional o accidental. Bajo esta premisa, los principales escenarios de riesgo que facilitan estas fugas se clasifican en:</p>
<list list-type="bullet">
<list-item><p>Filtraci&#x00F3;n no intencionada de datos personales: suele ocurrir cuando un usuario utiliza informaci&#x00F3;n personal (identificaci&#x00F3;n, tarjetas de cr&#x00E9;dito, contrase&#x00F1;as) en servicios inseguros o cuando una aplicaci&#x00F3;n confiable sufre una vulneraci&#x00F3;n.</p></list-item>
<list-item><p>Filtraci&#x00F3;n masiva no intencionada de datos: se produce cuando un usuario corporativo comparte informaci&#x00F3;n confidencial a trav&#x00E9;s de canales no oficiales, ya sea por desconocimiento de los protocolos de seguridad o por su ausencia (uso de aplicaciones de intercambio de archivos gratuitas, publicaci&#x00F3;n en cuentas FTP desatendidas, etc.).</p></list-item>
<list-item><p>Filtraci&#x00F3;n interna maliciosa de datos: se refiere a la acci&#x00F3;n de un empleado descontento (tambi&#x00E9;n conocido como <italic>insider</italic>) que recopila informaci&#x00F3;n confidencial sin el consentimiento de la organizaci&#x00F3;n para obtener alg&#x00FA;n tipo de beneficio.</p></list-item>
<list-item><p>Filtraci&#x00F3;n de datos por ataque externo: generalmente ocurre debido a ataques de ciberdelincuentes que buscan robar informaci&#x00F3;n interna de una organizaci&#x00F3;n para venderla o a grupos organizados dedicados al espionaje industrial y/o al robo de informaci&#x00F3;n estrat&#x00E9;gica a nivel militar y gubernamental.</p></list-item>
<list-item><p>Filtraci&#x00F3;n de datos por exposici&#x00F3;n de activos no controlados: hace referencia a la exposici&#x00F3;n de servicios desatendidos o mal configurados en internet, los cuales pueden ser explotados por ciberdelincuentes para obtener datos cr&#x00ED;ticos.</p></list-item>
</list>
<p>Independientemente del factor que la desencadene, cuando un actor malintencionado filtra datos cr&#x00ED;ticos, estos suelen hacerse p&#x00FA;blicos en internet con el fin de causar da&#x00F1;o reputacional, moral o psicol&#x00F3;gico, o bien para obtener ganancias mediante extorsi&#x00F3;n o venta en el mercado negro. En este &#x00FA;ltimo caso, la <italic>Dark Web</italic> representa uno de los principales canales de distribuci&#x00F3;n, con numerosas credenciales robadas disponibles en portales de compraventa (<xref ref-type="bibr" rid="ref-13-32279">Lin <italic>et al</italic>., 2020</xref>, p. 488). En la <xref ref-type="fig" rid="fig-2-32279">Imagen 2</xref> se muestra un ejemplo real de un servicio oculto en la <italic>Dark Web</italic> dedicado a la venta de filtraciones de datos, el cual, hasta el 01/11/2024, sigue activo.</p>
<fig id="fig-2-32279">
<label>Imagen 2:</label>
<caption><title>Ejemplo de un servicio oculto con filtraciones de datos</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-2-32279.jpg"/>
</fig>
<p>En cuanto al impacto en el sector empresarial, seg&#x00FA;n un estudio realizado por <xref ref-type="bibr" rid="ref-19-32279">Pimenta Rodrigues <italic>et al</italic>. (2024</xref>, p. 1), basado en una recopilaci&#x00F3;n de filtraciones de datos ocurridas entre 2018 y 2019 publicada por <xref ref-type="bibr" rid="ref-17-32279">Neto et al. (2021</xref>, pp. 1-33 <italic>passim</italic>), el sector con mayor incidencia de filtraciones de datos corresponde al sector tecnol&#x00F3;gico, seguido por los datos gubernamentales. Por otro lado, el informe realizado por Ewala IT Services (<xref ref-type="bibr" rid="ref-7-32279">Ewala IT Services, 2023</xref>, p. 14), una empresa especializada en la monitorizaci&#x00F3;n de filtraciones de datos, que ha recopilado m&#x00E1;s de 460 filtraciones de datos hasta la fecha, indica que, en 2023, el sector de la salud fue el m&#x00E1;s afectado, seguido por el sector tecnol&#x00F3;gico especializado en hardware.</p>
<p>Finalmente, existen escenarios de riesgo que trascienden el da&#x00F1;o reputacional, econ&#x00F3;mico y moral de una organizaci&#x00F3;n o usuario individual, alcanzando situaciones en las que la seguridad nacional se ve comprometida. Como ejemplo de ello, el 15 de enero de 2021, un ciberdelincuente intent&#x00F3; envenenar una planta de tratamiento de agua en la ciudad de Oldsmar, Florida, EE. UU. Seg&#x00FA;n <xref ref-type="bibr" rid="ref-3-32279"><italic>Cyberprotection Magazine</italic> (2021)</xref>, al respecto se sabe que el intento de sabotaje ocurri&#x00F3; porque el ciberdelincuente obtuvo una filtraci&#x00F3;n de datos que conten&#x00ED;a el nombre de usuario y la contrase&#x00F1;a de un exempleado de la planta, lo que le habr&#x00ED;a permitido el acceso remoto a trav&#x00E9;s de la aplicaci&#x00F3;n TeamViewer; este software permite, entre otras funcionalidades, el control remoto y la transferencia de archivos entre computadoras. El atacante intent&#x00F3; cambiar la concentraci&#x00F3;n de hidr&#x00F3;xido de sodio en el sistema de 100 a 11.100 partes por mill&#x00F3;n, afortunadamente, no se registraron v&#x00ED;ctimas por envenenamiento.</p>
<p>Dado lo expuesto en los p&#x00E1;rrafos anteriores, resulta evidente que las filtraciones de datos representan riesgos significativos para individuos, organizaciones y la sociedad. Afrontar los desaf&#x00ED;os que plantean estas filtraciones requiere medidas proactivas para su prevenci&#x00F3;n y, en caso de que esto no sea posible, reducir el impacto.</p>
</sec>
<sec sec-type="sec-3-32279">
<label>1.2</label>
<title>Miner&#x00ED;a de texto y su potencial uso en filtraciones de datos</title>
<p>Dado que la protecci&#x00F3;n de datos confidenciales ante filtraciones es una preocupaci&#x00F3;n creciente, la investigaci&#x00F3;n sobre enfoques de ciberseguridad para abordar este problema ha ganado atenci&#x00F3;n en los &#x00FA;ltimos a&#x00F1;os. La mayor&#x00ED;a de las investigaciones realizadas para abordar este problema se centran en los Sistemas de Prevenci&#x00F3;n de Filtraci&#x00F3;n de Datos (DLPS, por sus siglas en ingl&#x00E9;s), que han surgido como una barrera para hacer frente al problema (<xref ref-type="bibr" rid="ref-2-32279">Alneyadi <italic>et al</italic>., 2016</xref>, p. 1). Sin embargo, estos sistemas se centran en soluciones de software que no permiten examinar el contenido de las filtraciones. Una t&#x00E9;cnica interesante que a&#x00FA;n no ha sido explorada en profundidad es el an&#x00E1;lisis del texto contenido en las filtraciones. Esto ha sido mencionado brevemente por <xref ref-type="bibr" rid="ref-18-32279">Ojoawo <italic>et al</italic>. (s. f.</xref>, p. 14), quienes se basan en el an&#x00E1;lisis de texto a partir de la exploraci&#x00F3;n de redes sociales; aunque este enfoque puede ser muy interesante, la falta de estudios en este campo se debe al desaf&#x00ED;o que supone la heterogeneidad de los datos, que hacen que el estudio de t&#x00E9;cnicas preventivas basadas en software y hardware sea m&#x00E1;s r&#x00E1;pido que el an&#x00E1;lisis de la informaci&#x00F3;n filtrada. Sin embargo, si abordamos el problema desde una perspectiva social, en lugar de solo una econ&#x00F3;mica o de infraestructura, el impacto de los datos ya filtrados puede ser significativo, motivo por el cual es crucial comprender la informaci&#x00F3;n contenida en estas filtraciones.</p>
<p>La miner&#x00ED;a de informaci&#x00F3;n implica descubrir conocimientos a partir de grandes conjuntos de datos con el objetivo de extraer informaci&#x00F3;n &#x00FA;til; se basa, entre otros conceptos, en la agregaci&#x00F3;n de informaci&#x00F3;n, la cual permite, mediante el procesamiento en conjunto de estas grandes cantidades de informaci&#x00F3;n, detectar comportamientos que no pueden apreciarse en el dato individual. El aprendizaje autom&#x00E1;tico, una rama de la inteligencia artificial, se centra en desarrollar algoritmos y modelos que permiten a las m&#x00E1;quinas aprender y mejorar autom&#x00E1;ticamente cuando son expuestas a informaci&#x00F3;n, sin ser programadas expl&#x00ED;citamente para encontrar y extraer patrones concretos en los datos. En &#x00E1;mbitos con grandes cantidades de datos suponen un gran avance en relaci&#x00F3;n con la programaci&#x00F3;n expl&#x00ED;cita, la cual requerir&#x00ED;a una gran revisi&#x00F3;n humana para llegar a conocer primero todos los datos disponibles, as&#x00ED; como aquellos de inter&#x00E9;s particular. Estas tecnolog&#x00ED;as se utilizan cada vez m&#x00E1;s en ciberseguridad para detectar y prevenir amenazas cibern&#x00E9;ticas (<xref ref-type="bibr" rid="ref-16-32279">Nayak <italic>et al</italic>., 2020</xref>, p. 1), por ejemplo, mediante la aplicaci&#x00F3;n de aprendizaje autom&#x00E1;tico en este campo se puede analizar el tr&#x00E1;fico de la red en busca de comportamientos an&#x00F3;malos que indiquen posibles ataques, mientras que la miner&#x00ED;a de datos ayuda a identificar correos electr&#x00F3;nicos de <italic>phishing</italic> o <italic>malware</italic>, lo que permite a muchas aplicaciones de gestor de correo la creaci&#x00F3;n de carpetas inteligentes.</p>
<p>Extraer informaci&#x00F3;n de la filtraci&#x00F3;n de datos presenta diversos desaf&#x00ED;os relacionados con los formatos en los que se encuentra la informaci&#x00F3;n; no obstante, a pesar de la variedad de formatos de archivo, que incluye im&#x00E1;genes, bases de datos, hojas de Excel, documentos, correos electr&#x00F3;nicos, archivos PDF&#x2026;, entre otros, y a pesar de que cada formato requiere de t&#x00E9;cnicas especializadas para la extracci&#x00F3;n de su informaci&#x00F3;n, todos tienen en com&#x00FA;n el contener informaci&#x00F3;n de car&#x00E1;cter textual.</p>
<p>La miner&#x00ED;a de texto, un subcampo de la miner&#x00ED;a de informaci&#x00F3;n y el procesamiento del lenguaje natural (NLP), permite analizar los datos en texto no estructurado presentes en documentos filtrados. As&#x00ED;, una vez que el texto ha sido extra&#x00ED;do de los archivos, se pueden aplicar t&#x00E9;cnicas de miner&#x00ED;a de texto, como la recuperaci&#x00F3;n de informaci&#x00F3;n, la clasificaci&#x00F3;n de texto y el reconocimiento de entidades (<xref ref-type="bibr" rid="ref-10-32279">Guo <italic>et al</italic>., 2023</xref>, p. 1) para automatizar el an&#x00E1;lisis del contenido. M&#x00E1;s concretamente, en el an&#x00E1;lisis de filtraciones de datos, una combinaci&#x00F3;n de t&#x00E9;cnicas cl&#x00E1;sicas de miner&#x00ED;a de texto, como las b&#x00FA;squedas basadas en expresiones regulares, junto con el uso de modelos de lenguaje preentrenados (Language Models, LMs) que permiten el reconocimiento de entidades, puede ahorrar horas de b&#x00FA;squeda sobre los datos sensibles filtrados en comparaci&#x00F3;n con el tiempo que requerir&#x00ED;a dicha tarea a un humano. Estas t&#x00E9;cnicas permiten una exploraci&#x00F3;n exhaustiva de los datos filtrados, identificando patrones y tendencias cr&#x00ED;ticas para comprender la naturaleza y el alcance de la filtraci&#x00F3;n de informaci&#x00F3;n confidencial.</p>
<p>En conclusi&#x00F3;n, nuestro objetivo en este trabajo es extraer informaci&#x00F3;n relevante de diversas filtraciones de datos, permitiendo consultas posteriores, como determinar si el n&#x00FA;mero de tarjeta de cr&#x00E9;dito o el email de un individuo ha sido comprometido. Por esta raz&#x00F3;n, este proceso no solo implica procesar los archivos contenidos en la filtraci&#x00F3;n y extraer su texto para el posterior reconocimiento de entidades, sino tambi&#x00E9;n establecer una infraestructura eficiente de base de datos que facilite consultas posteriores de manera efectiva. A trav&#x00E9;s de este estudio, tambi&#x00E9;n buscamos evaluar las posibles implicaciones de estas filtraciones de datos en la privacidad de los individuos y la seguridad organizacional.</p>
</sec>
</sec>
<sec sec-type="sec-4-32279">
<label>2</label>
<title>M&#x00E9;todos</title>
<p>En las siguientes secciones, presentamos los principales servicios y m&#x00E9;todos utilizados para detectar y extraer datos filtrados en la <italic>Dark Web</italic>, as&#x00ED; como el modelo para la extracci&#x00F3;n de datos cr&#x00ED;ticos basado en miner&#x00ED;a de texto. La arquitectura propuesta se basa en el uso de herramientas de c&#x00F3;digo abierto y componentes de computaci&#x00F3;n en la nube para facilitar procesos de extracci&#x00F3;n de datos, garantizando que sea eficiente y escalable.</p>
<sec sec-type="sec-5-32279">
<label>2.1</label>
<title>Arquitectura conceptual</title>
<p>El objetivo de esta secci&#x00F3;n es describir la arquitectura de alto nivel presentada en la <xref ref-type="fig" rid="fig-3-32279">Imagen 3</xref>, que sirve como la columna vertebral del proyecto, proporcionando un marco para la implementaci&#x00F3;n de la soluci&#x00F3;n propuesta. El proceso general se distribuye en cuatro m&#x00F3;dulos l&#x00F3;gicos:</p>
<list list-type="bullet">
<list-item><p>Recopilaci&#x00F3;n de datos mediante <italic>Web Scraping</italic>: orientado a realizar <italic>Web Scraping</italic> en servicios ocultos de la <italic>Dark Web</italic>, utilizando el lenguaje de programaci&#x00F3;n Python junto con TOR SOCKS, un protocolo web que permite realizar solicitudes a la red TOR. El objetivo de este m&#x00F3;dulo es explorar autom&#x00E1;ticamente fuentes conocidas para descargar filtraciones de datos expuestas abiertamente en internet.</p></list-item>
<list-item><p>Almacenamiento de datos en bruto: responsable de almacenar los datos sin procesar en contenedores de datos tipo <italic>bucket</italic>. Estos datos son no estructurados y cada incorporaci&#x00F3;n representa un volumen variable de informaci&#x00F3;n, por lo que es esencial contar con un contenedor que permita almacenamiento ilimitado.</p></list-item>
<list-item><p>Procesamiento mediante miner&#x00ED;a de texto: dise&#x00F1;ado para explotar la informaci&#x00F3;n extra&#x00ED;da del texto de los archivos filtrados, aplicando t&#x00E9;cnicas de miner&#x00ED;a de texto para identificar datos personales valiosos que puedan ser vulnerables.</p></list-item>
<list-item><p>Explotaci&#x00F3;n de los resultados: este m&#x00F3;dulo proporciona acceso a trav&#x00E9;s de una API para realizar detecci&#x00F3;n temprana de los datos cr&#x00ED;ticos obtenidos, facilitando la integraci&#x00F3;n con otras herramientas de <italic>Threat Intelligence</italic> para enriquecer los procesos de seguridad operativa.</p></list-item>
</list>
<fig id="fig-3-32279">
<label>Imagen 3:</label>
<caption><title>Diagrama que ilustra la arquitectura de la soluci&#x00F3;n desarrollada</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-3-32279.jpg"/>
</fig>
<p>En las siguientes secciones, se explica en detalle cada m&#x00F3;dulo, proporcionando un desglose de sus funcionalidades, estrategias de implementaci&#x00F3;n e integraci&#x00F3;n dentro de la arquitectura general, con el objetivo de detallar el proceso seguido en la implementaci&#x00F3;n.</p>
</sec>
<sec sec-type="sec-6-32279">
<label>2.2</label>
<title>Recopilaci&#x00F3;n de datos mediante <italic>Web Scraping</italic></title>
<p>Seg&#x00FA;n la definici&#x00F3;n dada por <xref ref-type="bibr" rid="ref-14-32279">Ryan Mitchell (2015</xref>, p. 7), el t&#x00E9;rmino <italic>Web Scraping</italic> se refiere a la pr&#x00E1;ctica de recopilar autom&#x00E1;ticamente datos de internet. Es una t&#x00E9;cnica con una larga historia y, dado que se usa ampliamente en varios contextos, tambi&#x00E9;n puede encontrarse bajo t&#x00E9;rminos como <italic>screen scraping</italic>, <italic>data mining</italic>, <italic>web harvesting</italic> u otras variantes similares. Inicialmente, el <italic>Web Scraping</italic> estaba orientado a la obtenci&#x00F3;n de datos de la Web Superficial <italic>(Surface Web)</italic>; posteriormente, se desarrollaron adaptaciones espec&#x00ED;ficas para inspeccionar datos en la <italic>Deep Web</italic> (<xref ref-type="bibr" rid="ref-21-32279">Zhang <italic>et al</italic>., 2004</xref>, p. 1). Para esta investigaci&#x00F3;n, se ha propuesto un <italic>microservicio</italic> con la capacidad de recopilar datos de una fuente espec&#x00ED;fica en la <italic>Dark Web</italic>, aunque su uso puede extenderse a otras fuentes en el mercado negro de datos en internet. Un <italic>microservicio</italic> es un modelo arquitect&#x00F3;nico que separa grandes sistemas en peque&#x00F1;as unidades funcionales (<xref ref-type="bibr" rid="ref-11-32279">Karabey Aksakalli <italic>et al</italic>., 2021</xref>, p. 1). La idea b&#x00E1;sica del microservicio propuesto es la siguiente: dada una URL de la red TOR, el microservicio debe ser capaz de navegar por los enlaces presentes en la p&#x00E1;gina web para, en &#x00FA;ltima instancia, descargar filtraciones de datos.</p>
<p>El microservicio dise&#x00F1;ado para recopilar datos de la <italic>Dark Web</italic> requiere una serie de pasos espec&#x00ED;ficos para su implementaci&#x00F3;n en la red TOR, los cuales se detallan a continuaci&#x00F3;n:</p>
<list list-type="bullet">
<list-item><p><bold>Incorporar en el c&#x00F3;digo Python del microservicio la capacidad de abrir <italic>sockets</italic> en el puerto 9150</bold>. Los <italic>sockets</italic> son puntos de comunicaci&#x00F3;n que permiten que los procesos se comuniquen entre s&#x00ED;, ya sea en la misma m&#x00E1;quina o a trav&#x00E9;s de una red. Al abrir un <italic>socket</italic> en el puerto 9150, el microservicio podr&#x00E1; escuchar conexiones entrantes y comunicarse con otros procesos o servicios mediante el puerto especificado.</p></list-item>
<list-item><p><bold>Inspeccionar el sitio web en busca de enlaces</bold>. Este paso se lleva a cabo considerando las hojas de estilo en cascada (<italic>Cascading Style Sheets</italic> o CSS) utilizadas para el formato. El CSS juega un papel crucial en la definici&#x00F3;n de la presentaci&#x00F3;n visual del contenido web, incluyendo elementos como dise&#x00F1;o, colores, fuentes y espaciado. Esto permite identificar y seleccionar componentes espec&#x00ED;ficos de una p&#x00E1;gina web directamente desde el c&#x00F3;digo, utilizando propiedades y selectores CSS. Para este prop&#x00F3;sito, se ha utilizado la biblioteca <italic>BeautifulSoup</italic>.</p></list-item>
<list-item><p><bold>Iterar sobre los resultados de b&#x00FA;squeda</bold>, es decir, recorrer cada enlace que coincida con los par&#x00E1;metros CSS especificados en el c&#x00F3;digo Python.</p></list-item>
<list-item><p><bold>Inicializar el microservicio de <italic>Web Scraping</italic></bold>.</p></list-item>
</list>
<p>La fuente de datos seleccionada (<xref ref-type="fig" rid="fig-4-32279">Imagen 4</xref>) no requiere paginaci&#x00F3;n ni interacci&#x00F3;n con un sistema de inicio de sesi&#x00F3;n, ya que los datos compartidos en el servicio oculto seleccionado est&#x00E1;n organizados en una p&#x00E1;gina HTML est&#x00E1;tica, lo que reduce la complejidad en la detecci&#x00F3;n y la descarga de nuevas filtraciones de datos.</p>
<fig id="fig-4-32279">
<label>Imagen 4:</label>
<caption><title>Ejemplo de conexi&#x00F3;n mediante Python</title></caption>
<preformat>
cks.set_default_proxy(socks.SOCKS5, "localhost", 9150)
socket.socket = socks.socksocket
</preformat>
</fig>
<p>Dado que la adquisici&#x00F3;n il&#x00ED;cita de datos a trav&#x00E9;s de intrusiones ileg&#x00ED;timas constituye un delito de descubrimiento y revelaci&#x00F3;n de secretos, en las modalidades de intrusi&#x00F3;n o acceso indebido a sistemas inform&#x00E1;ticos (<xref ref-type="bibr" rid="ref-4-32279">C&#x00F3;digo Penal, 1995</xref>, art. 197) y que, aunque los investigadores no sean autores directos de tales delitos, podr&#x00ED;an estar incurriendo en un delito de recepci&#x00F3;n de informaci&#x00F3;n robada (<xref ref-type="bibr" rid="ref-5-32279">C&#x00F3;digo Penal, 1995</xref>, art. 298), para la presente demostraci&#x00F3;n, se ha simulado la descarga del material en el servicio oculto seleccionado de la <italic>Dark Web</italic>. Espec&#x00ED;ficamente, el conjunto de datos en bruto presentado en la secci&#x00F3;n &#x201C;Resultados Experimentales&#x201D; ha sido construido expresamente para cubrir este experimento, evitando as&#x00ED; que la acci&#x00F3;n de descarga constituya un delito.</p>
</sec>
<sec sec-type="sec-7-32279">
<label>2.3</label>
<title>Almacenamiento de datos en bruto</title>
<p>Una vez definido c&#x00F3;mo se obtienen los datos, el siguiente paso es determinar c&#x00F3;mo se almacenan en su formato original. En este proceso, se busca recopilar filtraciones relacionadas con una fecha espec&#x00ED;fica, reuniendo todos los datos relevantes.</p>
<p>En este sentido, es necesario introducir el concepto de <italic>Amazon Bucket</italic>, que se refiere a un recurso de almacenamiento en <italic>Amazon Web Services</italic> (AWS). En este estudio, se utiliza espec&#x00ED;ficamente un <italic>Amazon S3 Bucket</italic>. El t&#x00E9;rmino <italic>S3</italic> proviene de <italic>Simple Storage Service</italic>, ya que es un servicio de almacenamiento basado en la nube proporcionado por AWS, dise&#x00F1;ado para almacenar y recuperar grandes vol&#x00FA;menes de datos de manera segura y eficiente a trav&#x00E9;s de internet. As&#x00ED;, un <italic>Amazon S3 Bucket</italic> es esencialmente un contenedor para almacenar archivos y documentos dentro de la infraestructura de almacenamiento de <italic>Amazon S3</italic>.</p>
<p>Por lo tanto, una vez recopilados, los datos se almacenan en un <italic>Amazon Bucket</italic>, proporcionando una soluci&#x00F3;n de almacenamiento segura y escalable. Este enfoque garantiza que los datos en bruto permanezcan accesibles para su posterior an&#x00E1;lisis y procesamiento, mientras se siguen las mejores pr&#x00E1;cticas en gesti&#x00F3;n y almacenamiento de datos.</p>
</sec>
<sec sec-type="sec-8-32279">
<label>2.4</label>
<title>Procesamiento mediante miner&#x00ED;a de texto</title>
<p>El proceso de aplicaci&#x00F3;n de t&#x00E9;cnicas de miner&#x00ED;a de texto a los datos recopilados abarca varios pasos para extraer y analizar informaci&#x00F3;n textual de manera eficiente. Inicialmente, todos los archivos en su formato original deben ser le&#x00ED;dos para asegurar un conjunto de datos integral que permita analizar y detectar informaci&#x00F3;n potencialmente peligrosa.</p>
<p>Para abordar el desaf&#x00ED;o de procesar y extraer informaci&#x00F3;n &#x00FA;til de los archivos almacenados en un <italic>bucket</italic>, se deben seguir una serie de pasos metodol&#x00F3;gicos. En primer lugar, se debe garantizar la lectura correcta de los archivos en el <italic>bucket</italic>, lo que, aunque pueda parecer trivial, representa un desaf&#x00ED;o significativo debido a la diversidad de formatos de archivo e idiomas en los que pueden estar escritos los documentos. Este paso es crucial, ya que una lectura precisa que garantice la carga completa de los archivos es fundamental para el procesamiento posterior, especialmente cuando se trata de contenido en diferentes alfabetos. Un manejo incorrecto podr&#x00ED;a llevar a la p&#x00E9;rdida de datos o a una mala interpretaci&#x00F3;n de la informaci&#x00F3;n, por lo que es imperativo implementar t&#x00E9;cnicas de an&#x00E1;lisis y conversi&#x00F3;n de texto robustas. Para garantizar que todos los archivos puedan ser le&#x00ED;dos con precisi&#x00F3;n, independientemente de su formato o idioma, se ha utilizado la biblioteca <italic>chardet</italic> para detectar la codificaci&#x00F3;n correcta. A continuaci&#x00F3;n, se presenta un ejemplo m&#x00ED;nimo reproducible que utiliza <italic>chardet</italic> para leer archivos con codificaciones desconocidas.</p>
<fig id="fig-5-32279">
<label>Imagen 5:</label>
<caption><title>Ejemplo de c&#x00F3;digo para detectar la codificaci&#x00F3;n en archivo fuente</title></caption>
<preformat>
<styled-content style="color" style-type="violet">import <bold>chardet</bold></styled-content> &#x000A;
<italic># Funci&#x00F3;n para detector la condificaci&#x00F3;n del archivo</italic>
def <bold>detect_encoding</bold>(file_path):
&#x00A0;with <bold>open</bold>(file_path, 'rb') as f:
&#x00A0;raw_data = f.<bold>read</bold>()
&#x00A0;result = <bold>chardet.detect</bold>(raw_data)
&#x00A0;encoding = result['encoding']
&#x00A0;return encoding &#x000A;
<italic># Detecci&#x00F3;n de la condificaci&#x00F3;n</italic>
encoding = <bold>detect_encoding</bold>(file_path)
<bold>print</bold>(f"Detected encoding: &#x007B;encoding&#x007D;") &#x000A;
<italic># Lectura del archive con la codificaci&#x00F3;n detectada</italic>
with <bold>open</bold>(file_path, 'r', encoding=encoding) as f:
&#x00A0;content = f.<bold>read</bold>()
</preformat>
</fig>
<p>Posteriormente, determinar el tipo de archivo en funci&#x00F3;n de su extensi&#x00F3;n es crucial para manejar correctamente la extracci&#x00F3;n de texto. Una vez identificadas las caracter&#x00ED;sticas del archivo, el siguiente paso implica procesar el texto contenido en estos archivos.</p>
<p>Para ello, se emplea un m&#x00E9;todo especializado de extracci&#x00F3;n de texto, adaptado al tipo de archivo y a su codificaci&#x00F3;n espec&#x00ED;fica. Para abrir y leer el contenido sin errores, fue necesario considerar estas diferencias, lo que requiere desarrollar un c&#x00F3;digo que cubra exhaustivamente la naturaleza de todos los archivos que podr&#x00ED;an llegar a encontrarse potencialmente en la <italic>Dark Web</italic>.</p>
<p>Los archivos en formatos de texto plano, como.<italic>txt</italic>,.<italic>rtf</italic>,.<italic>msg</italic> o incluso formatos de c&#x00F3;digo como.<italic>sql</italic>,.<italic>java</italic>,.<italic>py</italic>, entre otros, pueden leerse como texto plano. Aunque los archivos con extensiones de c&#x00F3;digo pueden parecer irrelevantes a primera vista, pueden ser cruciales. Por ejemplo, los archivos.<italic>sql</italic> se utilizan para definir bases de datos y, si contienen datos almacenados dentro de ellos, podr&#x00ED;an incluir informaci&#x00F3;n sensible sobre los usuarios. Sin embargo, otros formatos, como archivos de.<italic>xlsx</italic> o.<italic>pdf</italic>, no pueden leerse de manera directa y requieren el uso de bibliotecas especializadas. La carga del texto de estos archivos se ha realizado en Python utilizando bibliotecas como <italic>pandas</italic> para manejar archivos.<italic>csv</italic> (que son texto plano, pero pueden gestionarse de manera m&#x00E1;s eficiente con esta biblioteca), <italic>openpyxl</italic> y <italic>xlrd</italic> para archivos con extensiones correspondientes al programa <italic>Excel</italic>, y <italic>PyPDF2</italic> para archivos PDF. Los archivos PDF presentan un desaf&#x00ED;o adicional, ya que requieren el uso de herramientas de reconocimiento &#x00F3;ptico de caracteres (<italic>OCR</italic>, por sus siglas en ingl&#x00E9;s) para extraer el texto despu&#x00E9;s de haber sido le&#x00ED;do el archivo. Adem&#x00E1;s, cuando se recuperan archivos desde el <italic>bucket</italic>, el flujo de datos difiere en comparaci&#x00F3;n con el acceso a archivos locales. Para mitigar posibles problemas, se almacena una copia temporal del archivo PDF en la m&#x00E1;quina local antes de extraer el texto. Esto garantiza un procesamiento m&#x00E1;s fluido y evita posibles retrasos o interrupciones relacionadas con la red al cargar el contenido del archivo en Python. A continuaci&#x00F3;n, se proporciona un ejemplo m&#x00ED;nimo de c&#x00F3;digo para ilustrar este proceso.</p>
<fig id="fig-6-32279">
<label>Imagen 6:</label>
<caption><title>Ejemplo de lectura y extracci&#x00F3;n de datos</title></caption>
<preformat>
... &#x000A;
<italic>&#x00A0;# Leer el PDF de forma local y extraer el texto</italic>
&#x00A0;text = ""
&#x00A0;with <bold>open</bold>(local_file_path, "rb") as file:
&#x00A0;reader = PdfReader(file)
<italic>&#x00A0;# Extraer texto de cada p&#x00E1;gina</italic>
&#x00A0;for page_number in <bold>range</bold>(<bold>len</bold>(reader.pages)):
&#x00A0;page = reader.pages[page_number]
&#x00A0;text += page.extract_text() &#x000A;
<italic>&#x00A0;# Eliminar el archive una vez procesaro</italic>
&#x00A0;os.remove(local_file_path)
</preformat>
</fig>
<p>Estas bibliotecas aseguran que los datos de texto est&#x00E9;n estandarizados y preparados para un an&#x00E1;lisis posterior, incluyendo tareas como la limpieza de datos y la normalizaci&#x00F3;n del texto.</p>
<p>Despu&#x00E9;s de la extracci&#x00F3;n del texto, se implementa el reconocimiento de entidades para analizar el texto procesado. Aunque los modelos preentrenados ofrecen amplias capacidades, pueden no ser siempre efectivos, especialmente cuando se trabaja con datos multiling&#x00FC;es y patrones espec&#x00ED;ficos. La implementaci&#x00F3;n de spaCy, una biblioteca de procesamiento del lenguaje natural en Python, resalta la importancia de personalizar los modelos para adaptarlos a necesidades espec&#x00ED;ficas. Adem&#x00E1;s, las variaciones ling&#x00FC;&#x00ED;sticas entre distintos idiomas pueden hacer que los modelos preentrenados en su versi&#x00F3;n por defecto sean insuficientes. En escenarios que involucran informaci&#x00F3;n sensible, utilizar la biblioteca para definir patrones en lugar de emplear modelos preentrenados completos resulta m&#x00E1;s pr&#x00E1;ctico y eficaz. En este contexto, confiar en la coincidencia de patrones <italic>(pattern matching)</italic> para el reconocimiento de entidades demuestra ser una ventaja. Este enfoque permite identificar entidades basadas en patrones predefinidos, asegurando una mayor precisi&#x00F3;n y relevancia dentro del contexto del conjunto de datos.</p>
<p>Por esta raz&#x00F3;n, se ha implementado un m&#x00F3;dulo para procesar los datos textuales utilizando varios extractores de informaci&#x00F3;n definidos por patrones, con el objetivo de recopilar diferentes entidades de informaci&#x00F3;n, como identificaciones (ID), correos electr&#x00F3;nicos, n&#x00FA;meros IBAN, entre otros. Estos extractores est&#x00E1;n dise&#x00F1;ados para identificar y extraer informaci&#x00F3;n vulnerable relevante del texto, bas&#x00E1;ndose en la b&#x00FA;squeda de patrones que caracterizan estas estructuras.</p>
<p>Por ejemplo, consideremos la detecci&#x00F3;n de direcciones de correo electr&#x00F3;nico. Estas pueden dividirse de la siguiente manera seg&#x00FA;n el patr&#x00F3;n mostrado a continuaci&#x00F3;n.</p>
<table-wrap id="tabw-1-32279">
<table id="tab-1-32279" frame="hsides" border="1" rules="all">
<col width="25%"/>
<col width="12%"/>
<col width="25%"/>
<col width="13%"/>
<col width="25%"/>
<tbody>
<tr>
<td valign="top" align="center"><p>usuario</p></td>
<td valign="top" align="center"><p>@</p></td>
<td valign="top" align="center"><p>dominio</p></td>
<td valign="top" align="center"><p>.</p></td>
<td valign="top" align="center"><p>extensi&#x00F3;n</p></td>
</tr>
</tbody>
</table>
</table-wrap>
<p>Esta definici&#x00F3;n evita la b&#x00FA;squeda literal y permite que, incluso si no conocemos la coincidencia exacta que estamos buscando, el texto real que coincide con estos patrones se recupere del documento. Utilizando estas entidades encontradas mediante patrones en el texto, el m&#x00F3;dulo almacena la informaci&#x00F3;n extra&#x00ED;da y procesada en una base de datos. Esta base de datos act&#x00FA;a como un repositorio centralizado para almacenar toda la informaci&#x00F3;n vulnerable relevante descubierta durante el proceso de miner&#x00ED;a de texto. Al almacenar los datos en un formato estructurado, la base de datos permite una gesti&#x00F3;n eficiente de la informaci&#x00F3;n, facilitando su recuperaci&#x00F3;n y an&#x00E1;lisis, lo que posibilita una exploraci&#x00F3;n m&#x00E1;s profunda y un mejor aprovechamiento de los conocimientos extra&#x00ED;dos.</p>
</sec>
<sec sec-type="sec-9-32279">
<label>2.5</label>
<title>Exploraci&#x00F3;n de los resultados</title>
<p>Este m&#x00F3;dulo de la arquitectura implica la consulta de la base de datos relacional dise&#x00F1;ada para almacenar toda la informaci&#x00F3;n obtenida. Este proceso conlleva la ejecuci&#x00F3;n de consultas en Python para extraer informaci&#x00F3;n espec&#x00ED;fica, como identificar qu&#x00E9; archivos contienen informaci&#x00F3;n vulnerable o determinar qu&#x00E9; tipo de informaci&#x00F3;n sensible est&#x00E1; presente en un archivo en particular. La base de datos relacional act&#x00FA;a como un repositorio estructurado que organiza y almacena los datos recopilados, asegurando una gesti&#x00F3;n eficiente y una recuperaci&#x00F3;n &#x00F3;ptima de la informaci&#x00F3;n.</p>
<p>Adicionalmente, para facilitar la interacci&#x00F3;n fluida con los datos almacenados, se ha desarrollado una API con <italic>endpoints</italic>. Estos <italic>endpoints</italic> permiten realizar consultas a la base de datos desde otras aplicaciones, brindando flexibilidad e interoperabilidad. A trav&#x00E9;s de estos puntos de acceso, aplicaciones externas pueden consultar y recuperar informaci&#x00F3;n relevante, aprovechando el conjunto de datos almacenado en la base de datos relacional. Esta API mejora la accesibilidad y la usabilidad de la arquitectura, permitiendo a los usuarios explorar y utilizar eficientemente los conocimientos obtenidos a partir de la exploraci&#x00F3;n de los resultados.</p>
</sec>
</sec>
<sec sec-type="sec-10-32279">
<label>3</label>
<title>Resultados</title>
<p>En primer lugar, se presenta evidencia de c&#x00F3;mo acceder a un servicio oculto en la red TOR dedicado a la distribuci&#x00F3;n de filtraciones de datos. Cabe destacar que la direcci&#x00F3;n de acceso a este servicio ha sido censurada para evitar su difusi&#x00F3;n. El ejemplo mostrado se refiere a un conjunto de datos sensibles provenientes del Fitzgibbon Hospital (EE. UU.). En la <xref ref-type="fig" rid="fig-7-32279">Imagen 7</xref>, se puede observar la descripci&#x00F3;n y el acceso a los archivos filtrados, mientras que, en la <xref ref-type="fig" rid="fig-8-32279">Imagen 8</xref>, se muestra el acceso espec&#x00ED;fico a cuentas de correo electr&#x00F3;nico en formato PDF.</p>
<fig id="fig-7-32279">
<label>Imagen 7:</label>
<caption><title>Ejemplo de un servicio oculto: descripci&#x00F3;n y acceso a los archivos de filtraci&#x00F3;n</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-4-32279.jpg"/>
</fig>
<fig id="fig-8-32279">
<label>Imagen 8:</label>
<caption><title>Ejemplo de un servicio oculto: acceso espec&#x00ED;fico a cuentas de correo electr&#x00F3;nico en formato PDF</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-5-32279.jpg"/>
</fig>
<p>Como se mencion&#x00F3; anteriormente, se llevar&#x00E1; a cabo una prueba de concepto para la extracci&#x00F3;n de entidades en un conjunto de datos simulado, espec&#x00ED;ficamente, un conjunto de datos ficticio que no contiene ninguna informaci&#x00F3;n confidencial o cr&#x00ED;tica de la empresa vulnerada, en este caso, <italic>Fitzgibbon Hospital</italic>. Este enfoque evita conflictos &#x00E9;ticos, as&#x00ED; como posibles da&#x00F1;os morales o legales relacionados con la adquisici&#x00F3;n y la manipulaci&#x00F3;n de datos obtenidos de manera ilegal.</p>
<sec sec-type="sec-11-32279">
<label>3.1</label>
<title>Ejemplo de un archivo</title>
<p>En la <xref ref-type="fig" rid="fig-9-32279">Imagen 9</xref> se muestra un ejemplo de un correo electr&#x00F3;nico que podr&#x00ED;a aparecer en una filtraci&#x00F3;n de datos y contener informaci&#x00F3;n vulnerable. Esta imagen ilustra la posible exposici&#x00F3;n de datos sensibles en tales filtraciones, enfatizando la necesidad de herramientas s&#x00F3;lidas de ciberseguridad para protegerse contra accesos no autorizados a informaci&#x00F3;n personal y confidencial.</p>
<fig id="fig-9-32279">
<label>Imagen 9:</label>
<caption><title>Ejemplo de un correo electr&#x00F3;nico que podr&#x00ED;a aparecer en una filtraci&#x00F3;n de datos y contener informaci&#x00F3;n vulnerable</title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-6-32279.jpg"/>
</fig>
<p>Por ejemplo, supongamos que en la imagen que se muestra en la <xref ref-type="fig" rid="fig-6-32279">Imagen 6</xref> apareci&#x00F3; en un archivo PDF dentro de una filtraci&#x00F3;n de datos; si un <italic>hacker</italic> accede a este archivo y encuentra un correo electr&#x00F3;nico que contiene tanto la direcci&#x00F3;n de correo como el n&#x00FA;mero IBAN de una persona, la combinaci&#x00F3;n de estas dos piezas de informaci&#x00F3;n puede facilitar el robo de identidad, fraudes financieros o incluso el acceso a cuentas bancarias; adem&#x00E1;s, aunque las transacciones suelen requerir una contrase&#x00F1;a, muchas personas a&#x00FA;n utilizan contrase&#x00F1;as de cuatro d&#x00ED;gitos f&#x00E1;cilmente <italic>hackeables</italic> con t&#x00E9;cnicas simples de fuerza bruta y exploraci&#x00F3;n basada en combinatoria, lo que aumenta el riesgo. Un atacante podr&#x00ED;a aprovechar esta informaci&#x00F3;n para realizar transacciones no autorizadas, como compras fraudulentas. Todo esto hace que la exposici&#x00F3;n simult&#x00E1;nea de una direcci&#x00F3;n de correo electr&#x00F3;nico y un n&#x00FA;mero IBAN en un mismo texto sea peligrosa, debido al riesgo de comprometer la privacidad y la seguridad financiera de la persona. Adem&#x00E1;s, revelar esta informaci&#x00F3;n en un solo texto aumenta la vulnerabilidad de la persona ante ataques de <italic>phishing</italic> y otros esquemas de ingenier&#x00ED;a social, donde los delincuentes intentan enga&#x00F1;ar a las v&#x00ED;ctimas para que revelen m&#x00E1;s informaci&#x00F3;n confidencial. Por lo tanto, es crucial proteger tanto la direcci&#x00F3;n de correo electr&#x00F3;nico como el IBAN de una persona y evitar que aparezcan juntos en el mismo documento para mitigar el riesgo de explotaci&#x00F3;n y abuso.</p>
<p>Por un lado, para identificar la direcci&#x00F3;n de correo electr&#x00F3;nico, el software emplea el patr&#x00F3;n previamente establecido, donde no es necesario definir el texto espec&#x00ED;fico del usuario, el dominio o la extensi&#x00F3;n, sino solo el conjunto de caracteres permitidos. Se puede observar una coincidencia en el texto con este patr&#x00F3;n al examinar la estructura construida con los s&#x00ED;mbolos &#x201C;@&#x201D; y &#x201C;.&#x201D;, como se muestra en la tabla siguiente.</p>
<table-wrap id="tabw-2-32279">
<table id="tab-2-32279" frame="hsides" border="1" rules="all">
<col width="25%"/>
<col width="12%"/>
<col width="25%"/>
<col width="13%"/>
<col width="25%"/>
<tbody>
<tr>
<td valign="top" align="center"><p>usuario</p></td>
<td valign="top" align="center"><p>@</p></td>
<td valign="top" align="center"><p>dominio</p></td>
<td valign="top" align="center"><p>.</p></td>
<td valign="top" align="center"><p>extensi&#x00F3;n</p></td>
</tr>
<tr>
<td valign="top" align="center"><p>landlordsemail</p></td>
<td valign="top" align="center"><p>@</p></td>
<td valign="top" align="center"><p>gmail</p></td>
<td valign="top" align="center"><p>.</p></td>
<td valign="top" align="center"><p>com</p></td>
</tr>
</tbody>
</table>
</table-wrap>
<p>De manera similar, el software est&#x00E1; programado para identificar otras secuencias de caracteres, como las que siguen el formato de un n&#x00FA;mero IBAN, una secuencia alfanum&#x00E9;rica (con o sin espacios) que identifica de manera &#x00FA;nica cuentas bancarias. Se puede observar que este patr&#x00F3;n es detectado en la informaci&#x00F3;n filtrada, permitiendo la identificaci&#x00F3;n y la extracci&#x00F3;n eficiente de n&#x00FA;meros IBAN en el conjunto de datos. Al utilizar estos dos extractores de entidades, la informaci&#x00F3;n resaltada en la <xref ref-type="fig" rid="fig-10-32279">Imagen 10</xref> se extraer&#x00ED;a del correo electr&#x00F3;nico y se almacenar&#x00ED;a en la base de datos, haci&#x00E9;ndola disponible para futuras consultas.</p>
<fig id="fig-10-32279">
<label>Imagen 10:</label>
<caption><title>Patrones detectados en la imagen del correo electr&#x00F3;nico mostrada en la <xref ref-type="fig" rid="fig-6-32279">Imagen 6</xref></title></caption>
<graphic xmlns:xlink="http://www.w3.org/1999/xlink" xlink:href="fig-7-32279.jpg"/>
</fig>
<p>Si bien este ejemplo ilustra un proceso de detecci&#x00F3;n sencillo, dado que el contenido del archivo es peque&#x00F1;o, es fundamental reconocer que el procesamiento manual de conjuntos de datos m&#x00E1;s grandes consumir&#x00ED;a una cantidad considerable de tiempo y recursos. En contraste, las capacidades automatizadas del software propuesto permiten detectar y categorizar informaci&#x00F3;n relevante de manera r&#x00E1;pida y eficiente, permitiendo a los usuarios gestionar y analizar grandes vol&#x00FA;menes de datos en cuesti&#x00F3;n de segundos. Esto pone en valor los beneficios significativos en t&#x00E9;rminos de ahorro de tiempo y mejora de la productividad que ofrecen las soluciones automatizadas de procesamiento de datos en comparaci&#x00F3;n con los m&#x00E9;todos manuales.</p>
<p>El hecho de que toda la informaci&#x00F3;n recopilada a partir del texto se almacene posteriormente en una base de datos relacional dedicada para su an&#x00E1;lisis posterior permite realizar consultas sobre la informaci&#x00F3;n extra&#x00ED;da de manera eficiente y escalable.</p>
</sec>
</sec>
<sec sec-type="sec-12-32279">
<label>4</label>
<title>Conclusi&#x00F3;n y trabajo futuro</title>
<p>A trav&#x00E9;s de la investigaci&#x00F3;n realizada, se ha evidenciado que la metodolog&#x00ED;a propuesta, basada en la captura y el procesamiento de datos filtrados de la <italic>Dark Web</italic>, ofrece una soluci&#x00F3;n prometedora para abordar los desaf&#x00ED;os que plantean las filtraciones de datos. Mediante la aplicaci&#x00F3;n de t&#x00E9;cnicas de miner&#x00ED;a de texto, la detecci&#x00F3;n de informaci&#x00F3;n cr&#x00ED;tica dentro de los datos filtrados se ha automatizado significativamente, mejorando as&#x00ED; la eficiencia y la precisi&#x00F3;n en la identificaci&#x00F3;n de informaci&#x00F3;n vulnerable.</p>
<p>Sin embargo, es crucial reconocer los desaf&#x00ED;os encontrados, particularmente en lo que respecta a los problemas de codificaci&#x00F3;n en diferentes idiomas, los cuales pueden afectar los procesos de tokenizaci&#x00F3;n. Para abordar este problema, futuras investigaciones se centrar&#x00E1;n en el desarrollo de mecanismos robustos de detecci&#x00F3;n de codificaci&#x00F3;n de lenguaje que puedan identificar y manejar autom&#x00E1;ticamente distintos idiomas, asegurando una tokenizaci&#x00F3;n precisa en datos no estructurados. Adem&#x00E1;s, la exploraci&#x00F3;n de t&#x00E9;cnicas avanzadas de tokenizaci&#x00F3;n, como la tokenizaci&#x00F3;n por subpalabras (sub-word tokenization) o la codificaci&#x00F3;n byte-pair encoding (BPE), podr&#x00ED;a proporcionar una mayor flexibilidad para manejar distintos idiomas y conjuntos de caracteres.</p>
<p>Al invertir en investigaci&#x00F3;n y desarrollo para abordar los desaf&#x00ED;os presentados en este trabajo, se ofrece una herramienta valiosa para mejorar el bienestar social, ya que no solo permite la detecci&#x00F3;n temprana de riesgos, sino que tambi&#x00E9;n contribuye a fomentar un entorno digital m&#x00E1;s seguro para individuos y organizaciones.</p>
<p>La adopci&#x00F3;n de la arquitectura introducida en este trabajo representa un paso adelante en la mejora de las medidas de ciberseguridad, proporcionando un enfoque m&#x00E1;s r&#x00E1;pido y efectivo para mitigar los riesgos asociados con las amenazas cibern&#x00E9;ticas. En general, los hallazgos destacan la importancia de las medidas proactivas y las innovaciones tecnol&#x00F3;gicas en la protecci&#x00F3;n de la seguridad y privacidad de los usuarios en un panorama digital cada vez m&#x00E1;s interconectado.</p>
<p>Con todo ello, el trabajo pretende servir como prueba de concepto para el desarrollo de una herramienta de <italic>Threat Intelligence</italic> capaz de ejecutar una monitorizaci&#x00F3;n continua de la <italic>Dark Web</italic> y la <italic>Surface Web</italic> en busca de fuentes de datos fugados; una vez hecha la correspondiente detecci&#x00F3;n, la arquitectura de la herramienta permitir&#x00E1; extraer, almacenar y tratar la informaci&#x00F3;n con fines preventivos, esto es, cuando una entidad perteneciente a un usuario a proteger (DNI, tel&#x00E9;fono, cuenta bancaria, correo electr&#x00F3;nico, etc.) haga un <italic>match</italic> con un dato almacenado proveniente del mercado negro, la herramienta dar&#x00E1; parte al propietario de la informaci&#x00F3;n, avisando del potencial riesgo asociado; el c&#x00E1;lculo del riesgo se determinar&#x00E1; seg&#x00FA;n una m&#x00E9;trica que contemple el siguiente conjunto de variables: categor&#x00ED;a del usuario a proteger (responsable de sistemas, VIP, CEO, etc.), naturaleza de la entidad (DNI, tel&#x00E9;fono, cuenta bancaria, correo electr&#x00F3;nico, etc.) y antig&#x00FC;edad de la filtraci&#x00F3;n.</p>
<p>Finalmente, y como mejora de largo recorrido, se pretende dotar a la tecnolog&#x00ED;a resultante de un enriquecimiento de los datos mediante fuentes OSINT; la integraci&#x00F3;n con fuentes abiertas supone una mejora sustancial en la interpretaci&#x00F3;n de los riesgos asociados con un usuario o conjunto de usuarios, ya que facilita una lectura completa de la superficie de exposici&#x00F3;n ante otros potenciales riesgos tecnol&#x00F3;gicos o pr&#x00E1;cticas delictivas como pueden ser el <italic>doxxing</italic> o el <italic>scam</italic>.</p>
</sec>
</body>
<back>
<fn-group>
<fn id="fn1" fn-type="other"><label>1</label> <p>Profesora doctora en inform&#x00E1;tica, asociada al &#x00E1;rea de Ciencia de la Computaci&#x00F3;n e Inteligencia Artificial en la Universidad de Oviedo.</p></fn>
<fn id="fn2" fn-type="other"><label>2</label> <p>Profesor doctor en Criminolog&#x00ED;a, asociado a la Escuela Superior de Ingenier&#x00ED;a y Tecnolog&#x00ED;a, as&#x00ED; como tambi&#x00E9;n a la Facultad de Derecho, ambas pertenecientes a la Universidad Internacional de La Rioja. Autora de correspondencia.</p></fn>
<fn id="fn3" fn-type="other"><label>3</label> <p>Doctora. Head of Research and Innovation en Ewala IT Services.</p></fn>
</fn-group>
<ref-list>
<title>Bibliograf&#x00ED;a</title>
<ref id="ref-1-32279"><mixed-citation publication-type="conf-proc"><person-group person-group-type="author"><string-name><surname>Al Nabki</surname>, <given-names>M. W.</given-names></string-name>, <string-name><surname>Fidalgo</surname>, <given-names>E.</given-names></string-name>, <string-name><surname>Alegre</surname>, <given-names>E.</given-names></string-name> y <string-name><surname>De Paz</surname>, <given-names>I.</given-names></string-name></person-group> (<year>2017</year>). <article-title>Classifying illegal activities on Tor network based on web textual contents</article-title>. <comment>En</comment> <conf-name>Conference of the European Chapter of the Association for Computational Linguistics</conf-name> (<comment>pp.</comment> <fpage>35</fpage>-<lpage>43</lpage>). <pub-id pub-id-type="doi">10.18653/V1/E17-1004</pub-id></mixed-citation></ref>
<ref id="ref-2-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Alneyadi</surname>, <given-names>S.</given-names></string-name>, <string-name><surname>Sithirasenan</surname>, <given-names>E.</given-names></string-name> y <string-name><surname>Muthukkumarasamy</surname>, <given-names>V.</given-names></string-name></person-group> (<year>2016</year>). <article-title>A survey on data leakage prevention systems</article-title>. <source><italic>Journal of Network and Computer Applications</italic></source>, <volume>62</volume>, <fpage>137</fpage>-<lpage>152</lpage>. <pub-id pub-id-type="doi">10.1016/j.jnca.2016.01.008</pub-id></mixed-citation></ref>
<ref id="ref-3-32279"><mixed-citation publication-type="webpage"><person-group person-group-type="author"><collab>Ciberprotection-magazine</collab></person-group>. (<year>2021</year>). <source><italic>Here is how hackers attacked the Oldsmar water supply &#x2013; and how a catastrophe was prevented</italic></source>. <date-in-citation content-type="access-date">Recuperado el 12-02-2021</date-in-citation> <comment>de <ext-link ext-link-type="uri" xlink:href="https://cyberprotection-magazine.com/here-is-how-hackers-attacked-the-oldsmar-water-supply-and-how-a-catastrophe-was-prevented">https://cyberprotection-magazine.com/here-is-how-hackers-attacked-the-oldsmar-water-supply-and-how-a-catastrophe-was-prevented</ext-link></comment></mixed-citation></ref>
<ref id="ref-4-32279"><mixed-citation publication-type="book"><person-group person-group-type="author"><collab>C&#x00F3;digo Penal [CP]</collab></person-group>. <source>Art. 197</source>. <date-in-citation content-type="access-date">24 noviembre de 1995</date-in-citation> (<publisher-loc>Espa&#x00F1;a</publisher-loc>).</mixed-citation></ref>
<ref id="ref-5-32279"><mixed-citation publication-type="book"><person-group person-group-type="author"><collab>C&#x00F3;digo Penal [CP]</collab></person-group>. <source>Art. 298</source>. <date-in-citation content-type="access-date">24 de noviembre de 1995</date-in-citation> (<publisher-loc>Espa&#x00F1;a</publisher-loc>).</mixed-citation></ref>
<ref id="ref-6-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Connolly</surname>, <given-names>K.</given-names></string-name>, <string-name><surname>Klempay</surname>, <given-names>A.</given-names></string-name>, <string-name><surname>McCann</surname>, <given-names>M.</given-names></string-name> y <string-name><surname>Brenner</surname>, <given-names>P.</given-names></string-name></person-group> (<year>2023</year>). <article-title>Dark web marketplaces: Data for collaborative threat intelligence</article-title>. <source><italic>Digital Threats: Research and Practice</italic></source>, <volume>4</volume>(<issue>4</issue>), <fpage>1</fpage>-<lpage>12</lpage>. <pub-id pub-id-type="doi">10.1145/3615666</pub-id></mixed-citation></ref>
<ref id="ref-7-32279"><mixed-citation publication-type="webpage"><person-group person-group-type="author"><collab>Ewala IT Services</collab></person-group>. (<year>2023</year>). <source><italic>Karonte Fuga de Datos</italic></source>. <ext-link ext-link-type="uri" xlink:href="https://www.karont3.tech/img/cms/Karont3%20Tendencias%202023_12%201.pdf">https://www.karont3.tech/img/cms/Karont3%20Tendencias%202023_12%201.pdf</ext-link></mixed-citation></ref>
<ref id="ref-8-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Gallo-Serpillo</surname>, <given-names>F.</given-names></string-name> y <string-name><surname>Valls-Prieto</surname>, <given-names>J.</given-names></string-name></person-group> (<year>2024</year>). <article-title>Analysis of CSEM offenders on the dark web using honeypots to geolocate IP addresses from Spain</article-title>. <source><italic>Computers in Human Behavior</italic></source>, <volume>154</volume>(<issue>108137</issue>), <elocation-id>108137</elocation-id>. <pub-id pub-id-type="doi">10.1016/j.chb.2024.108137</pub-id></mixed-citation></ref>
<ref id="ref-9-32279"><mixed-citation publication-type="book"><person-group person-group-type="author"><string-name><surname>Gede</surname>, <given-names>I.</given-names></string-name>, <string-name><surname>Rahayuda</surname>, <given-names>S.</given-names></string-name>, <string-name><surname>Putu</surname>, <given-names>N.</given-names></string-name> y <string-name><surname>Santiari</surname>, <given-names>L.</given-names></string-name></person-group> (<year>2017</year>). <source><italic>Crawling and Cluster Hidden Web Using Crawler Framework and Fuzzy-KNN</italic></source>. <publisher-loc>Conference</publisher-loc>: <publisher-name>2017 5th International Conference on Cyber and IT Service Management (CITSM)</publisher-name>.</mixed-citation></ref>
<ref id="ref-10-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Guo</surname>, <given-names>Z.</given-names></string-name>, <string-name><surname>Jin</surname>, <given-names>R.</given-names></string-name>, <string-name><surname>Liu</surname>, <given-names>C.</given-names></string-name>, <string-name><surname>Huang</surname>, <given-names>Y.</given-names></string-name>, <string-name><surname>Shi</surname>, <given-names>D.</given-names></string-name>, Supryadi, <string-name><surname>Yu</surname>, <given-names>L.</given-names></string-name>, <string-name><surname>Liu</surname>, <given-names>Y.</given-names></string-name>, <string-name><surname>Li</surname>, <given-names>J.</given-names></string-name>, <string-name><surname>Xiong</surname>, <given-names>B.</given-names></string-name> y <string-name><surname>Xiong</surname>, <given-names>D.</given-names></string-name></person-group> (<year>2023</year>). <article-title>Evaluating large language models: A comprehensive survey</article-title>. <source><italic>arXiv</italic> [cs.CL]</source>. <ext-link ext-link-type="uri" xlink:href="http://arxiv.org/abs/2310.19736">http://arxiv.org/abs/2310.19736</ext-link></mixed-citation></ref>
<ref id="ref-11-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Karabey Aksakalli</surname>, <given-names>I.</given-names></string-name>, <string-name><surname>&#x00C7;elik</surname>, <given-names>T.</given-names></string-name>, <string-name><surname>Can</surname>, <given-names>A. B.</given-names></string-name> y <string-name><surname>Teki&#x0307;nerdo&#x011F;an</surname>, <given-names>B.</given-names></string-name></person-group> (<year>2021</year>). <article-title>Deployment and communication patterns in microservice architectures: A systematic literature review</article-title>. <source><italic>The Journal of Systems and Software</italic></source>, <volume>180</volume>(<issue>111014</issue>), <elocation-id>111014</elocation-id>. <pub-id pub-id-type="doi">10.1016/j.jss.2021.111014</pub-id></mixed-citation></ref>
<ref id="ref-12-32279"><mixed-citation publication-type="book"><person-group person-group-type="author"><string-name><surname>Lacey</surname>, <given-names>D.</given-names></string-name> y <string-name><surname>Salmon</surname>, <given-names>P. M.</given-names></string-name></person-group> (<year>2015</year>). <chapter-title>It&#x2019;s dark in there: Using systems analysis to investigate trust and engagement in dark web forums</chapter-title>. <comment>En</comment> <source><italic>Lecture Notes in Computer Science</italic></source> (<comment>pp.</comment> <fpage>117</fpage>-<lpage>128</lpage>). <publisher-name>Springer International Publishing</publisher-name>.</mixed-citation></ref>
<ref id="ref-13-32279"><mixed-citation publication-type="conf-proc"><person-group person-group-type="author"><string-name><surname>Lin</surname>, <given-names>F.</given-names></string-name>, <string-name><surname>Liu</surname>, <given-names>Y.</given-names></string-name>, <string-name><surname>Ebrahimi</surname>, <given-names>M.</given-names></string-name>, <string-name><surname>Ahmad-Post</surname>, <given-names>Z.</given-names></string-name>, <string-name><surname>Hu</surname>, <given-names>J. L.</given-names></string-name>, <string-name><surname>Xin</surname>, <given-names>J.</given-names></string-name>, <string-name><surname>Samtani</surname>, <given-names>S.</given-names></string-name>, <string-name><surname>Li</surname>, <given-names>W.</given-names></string-name> y <string-name><surname>Chen</surname>, <given-names>H.</given-names></string-name></person-group> (<year>2020</year>). <article-title>Linking personally identifiable information from the dark web to the surface web: A deep entity resolution approach</article-title>. <comment>En</comment> <conf-name>2020 International Conference on Data Mining Workshops (ICDMW)</conf-name> (<comment>pp.</comment> <fpage>488</fpage>-<lpage>495</lpage>).</mixed-citation></ref>
<ref id="ref-14-32279"><mixed-citation publication-type="book"><person-group person-group-type="author"><string-name><surname>Mitchell</surname>, <given-names>R.</given-names></string-name></person-group> (<year>2015</year>). <source><italic>Web scraping with Python: Collecting more data from the modern web</italic></source>. <publisher-name>O&#x2019;Reilly Media</publisher-name>.</mixed-citation></ref>
<ref id="ref-15-32279"><mixed-citation publication-type="conf-proc"><person-group person-group-type="author"><string-name><surname>Naskali</surname>, <given-names>J.</given-names></string-name>, <string-name><surname>Rantanen</surname>, <given-names>M.</given-names></string-name>, <string-name><surname>Rottenkolber</surname>, <given-names>M.</given-names></string-name> y <string-name><surname>Kimppa</surname>, <given-names>K. K.</given-names></string-name></person-group> (<year>2024</year>). <conf-name>Smart Ethics in the Digital World. Proceedings of the ETHICOMP 2024</conf-name>. <source><italic>Smart Ethics in the Digital World Logro&#x00F1;o</italic></source>.</mixed-citation></ref>
<ref id="ref-16-32279"><mixed-citation publication-type="conf-proc"><person-group person-group-type="author"><string-name><surname>Nayak</surname>, <given-names>S. K.</given-names></string-name> y <string-name><surname>Ojha</surname>, <given-names>A. C.</given-names></string-name></person-group> (<year>2020</year>). <article-title>Data leakage detection and prevention: Review and research directions</article-title>. <comment>En</comment> <conf-name>Machine Learning and Information Processing: Proceedings of ICMLIP 2019</conf-name> (<comment>pp.</comment> <fpage>203</fpage>-<lpage>212</lpage>).</mixed-citation></ref>
<ref id="ref-17-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Neto</surname>, <given-names>N. N.</given-names></string-name>, <string-name><surname>Madnick</surname>, <given-names>S.</given-names></string-name>, <string-name><surname>Paula</surname>, <given-names>A. M. G. D.</given-names></string-name> y <string-name><surname>Borges</surname>, <given-names>N. M.</given-names></string-name></person-group> (<year>2021</year>). <article-title>Developing a global data breach database and the challenges encountered</article-title>. <source><italic>ACM Journal of Data and Information Quality</italic></source>, <volume>13</volume>(<issue>1</issue>), <fpage>1</fpage>-<lpage>33</lpage>. <pub-id pub-id-type="doi">10.1145/3439873</pub-id></mixed-citation></ref>
<ref id="ref-18-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Ojoawo</surname>, <given-names>A. O.</given-names></string-name>, <string-name><surname>Fagbolu</surname>, <given-names>O. O.</given-names></string-name>, <string-name><surname>Olaniyan</surname>, <given-names>A. S.</given-names></string-name> y <string-name><surname>Sonubi</surname>, <given-names>T. A.</given-names></string-name></person-group> (<comment>s. f.</comment>). <article-title>Data leak protection using text mining and social network analysis</article-title>. <source><ext-link ext-link-type="uri" xlink:href="http://Ijerd.com">Ijerd.com</ext-link></source>. <date-in-citation content-type="access-date">Recuperado el 2-3-2025</date-in-citation> <comment>de: <ext-link ext-link-type="uri" xlink:href="http://www.ijerd.com/paper/vol10-issue12/Version_3/B10121422.pdf">http://www.ijerd.com/paper/vol10-issue12/Version_3/B10121422.pdf</ext-link></comment></mixed-citation></ref>
<ref id="ref-19-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Pimenta Rodrigues</surname>, <given-names>G. A.</given-names></string-name>, <string-name><surname>Marques Serrano</surname>, <given-names>A. L.</given-names></string-name>, <string-name><surname>Lopes Espi&#x00F1;eira Lemos</surname>, <given-names>A. N.</given-names></string-name>, <string-name><surname>Canedo</surname>, <given-names>E. D.</given-names></string-name>, <string-name><surname>Mendon&#x00E7;a</surname>, <given-names>F. L. L. de</given-names></string-name>, <string-name><surname>De Oliveira Albuquerque</surname>, <given-names>R.</given-names></string-name>, <string-name><surname>Sandoval Orozco</surname>, <given-names>A. L.</given-names></string-name> y <string-name><surname>Garc&#x00ED;a Villalba</surname>, <given-names>L. J.</given-names></string-name></person-group> (<year>2024</year>). <article-title>Understanding data breach from a global perspective: Incident visualization and data protection law review</article-title>. <source><italic>Data</italic></source>, <volume>9</volume>(<issue>2</issue>), <fpage>27</fpage>. <pub-id pub-id-type="doi">10.3390/data9020027</pub-id></mixed-citation></ref>
<ref id="ref-20-32279"><mixed-citation publication-type="journal"><person-group person-group-type="author"><string-name><surname>Saleem</surname>, <given-names>J.</given-names></string-name>, <string-name><surname>Islam</surname>, <given-names>R.</given-names></string-name> y <string-name><surname>Kabir</surname>, <given-names>M. A.</given-names></string-name></person-group> (<year>2022</year>). <article-title>The anonymity of the dark web: A survey</article-title>. <source>IEEE Access: <italic>Practical Innovations, Open Solutions</italic></source>, <volume>10</volume>, <fpage>33628</fpage>-<lpage>33660</lpage>. <pub-id pub-id-type="doi">10.1109/access.2022.3161547</pub-id></mixed-citation></ref>
<ref id="ref-21-32279"><mixed-citation publication-type="conf-proc"><person-group person-group-type="author"><string-name><surname>Zhang</surname>, <given-names>Z.</given-names></string-name>, <string-name><surname>He</surname>, <given-names>B.</given-names></string-name> y <string-name><surname>Chang</surname>, <given-names>K. C.-C.</given-names></string-name></person-group> (<year>2004</year>). <article-title>Understanding Web query interfaces: Best-effort parsing with hidden syntax</article-title>. <comment>En</comment> <conf-name>Proceedings of the 2004 ACM SIGMOD International Conference on Management of Data</conf-name> (<comment>pp.</comment> <fpage>107</fpage>-<lpage>118</lpage>).</mixed-citation></ref>
</ref-list>
</back>
</article>
