diff --git a/docs/report/ML_report.pdf b/docs/report/ML_report.pdf index 1829f2d..c2019ec 100644 Binary files a/docs/report/ML_report.pdf and b/docs/report/ML_report.pdf differ diff --git a/docs/report/main.tex b/docs/report/main.tex index 51478a8..b49de83 100644 --- a/docs/report/main.tex +++ b/docs/report/main.tex @@ -146,7 +146,7 @@ \section{Estado del Arte} \subsection{Modelos de Segmentación} La segmentación de imágenes ha estado dominada históricamente por las Redes Neuronales Convolucionales (CNN) \cite{sakib2019overview}. El modelo \emph{U-Net} es el estándar para arquitecturas de codificador-decodificador con conexiones de salto, permitiendo recuperar detalles espaciales finos \cite{ronneberger2015unet, cao2021swinunet}. En el ámbito de la microscopía electrónica (SEM), modelos como \emph{Mask R-CNN} se utilizan para la segmentación de instancias, permitiendo delimitar partículas individuales incluso en configuraciones de aglomerados \cite{monchot2021titanium, liu2021swin}. -Recientemente, el \emph{Vision Transformer (ViT)} ha demostrado que es posible prescindir de las convoluciones al tratar parches de imagen como secuencias, capturando dependencias globales que las CNN suelen omitir \cite{dosovitskiy2021vit, cao2021swinunet}. No obstante, el ViT presenta una complejidad computacional cuadrática respecto al tamaño de la imagen, lo que dificulta su uso en tareas de predicción densa \cite{liu2021swin}. Para solucionar esto, el \emph{Swin Transformer} introduce mapas de características jerárquicos y un esquema de atención en ventanas desplazadas (\textit{shifted windows}), logrando una complejidad lineal \cite{liu2021swin}. Basado en esto, el modelo \emph{Swin-Unet} propone una arquitectura puramente basada en Transformers con estructura en forma de U para segmentación precisa, sustituyendo las operaciones de convolución por bloques de Swin Transformer \cite{cao2021swinunet}. +Recientemente, el \emph{Vision Transformer (ViT)} ha demostrado que es posible prescindir de las convoluciones al tratar parches de imagen como secuencias, capturando dependencias globales que las CNN suelen omitir \cite{dosovitskiy2021vit, cao2021swinunet, Zhang_2024}. No obstante, el ViT presenta una complejidad computacional cuadrática respecto al tamaño de la imagen, lo que dificulta su uso en tareas de predicción densa \cite{liu2021swin}. Para solucionar esto, el \emph{Swin Transformer} introduce mapas de características jerárquicos y un esquema de atención en ventanas desplazadas (\textit{shifted windows}), logrando una complejidad lineal \cite{liu2021swin}. Basado en esto, el modelo \emph{Swin-Unet} propone una arquitectura puramente basada en Transformers con estructura en forma de U para segmentación precisa, sustituyendo las operaciones de convolución por bloques de Swin Transformer \cite{cao2021swinunet}. \subsection{Clasificación de Imágenes} La clasificación de imágenes es fundamental cuando se emplean estrategias de segmentación mediante \textit{quadtrees} o ventanas deslizantes (\textit{sliding windows}). Modelos de CNN como \emph{ResNet} han sido la opción predeterminada debido a sus conexiones residuales que facilitan el entrenamiento profundo \cite{he2016resnet, sakib2019overview}. En microscopía electrónica, se han implementado bloques de \emph{EfficientNetB7} para clasificar morfologías de parches con alta precisión \cite{classification_report}. diff --git a/docs/report/references.bib b/docs/report/references.bib index 274b836..100992c 100644 --- a/docs/report/references.bib +++ b/docs/report/references.bib @@ -86,4 +86,17 @@ @misc{classification_report author = {Day, Alexandra L. and others}, year = {2024}, note = {Northwestern University} -} \ No newline at end of file +} + +@article{Zhang_2024, + title={Vision Transformers: From Semantic Segmentation to Dense Prediction}, + volume={132}, + ISSN={1573-1405}, + url={http://dx.doi.org/10.1007/s11263-024-02173-w}, + DOI={10.1007/s11263-024-02173-w}, + number={12}, + journal={International Journal of Computer Vision}, + publisher={Springer Science and Business Media LLC}, + author={Zhang, Li and Lu, Jiachen and Zheng, Sixiao and Zhao, Xinxuan and Zhu, Xiatian and Fu, Yanwei and Xiang, Tao and Feng, Jianfeng and Torr, Philip H. S.}, + year={2024}, + month=jul, pages={6142–6162} }