본문 바로가기

전체 글332

보호되어 있는 글 입니다. 2026. 8. 25.
d 보호되어 있는 글 입니다. 2026. 8. 13.
「정보보호 및 개인정보보호 관리체계 인증제 실효성 강화방안」 정리 더보기https://app.notion.com/p/tidy-thunder-8heee/3974d13e1df88026a7cef740176718f1?source=copy_link 「정보보호 및 개인정보보호 관리체계 인증제 실효성 강화방안」 정리 | Notion1. 추진 배경app.notion.com발표일: 2026-04-10 (과학기술정보통신부·개인정보보호위원회)https://www.pipc.go.kr/np/cop/bbs/selectBoardArticle.do?bbsId=BS074&mCode=C020010000&nttId=11976#LINK배경 : 인증기업에서도 침해사고가 반복되며 ISMS·ISMS-P 인증제도의 실효성 논란 확대개편 방향 : 인증 대상 확대, 심사방식 개선, 사후관리 강화, 심사기관·심사원 .. 2026. 7. 9.
[AI Privacy Lab] Transformer 이해 실습 보호되어 있는 글 입니다. 2025. 11. 30.
[AI Privacy] Transformer와 Attention Mechanism, Encoder-Decoder Architecture, GPT Architecture, 대규모 멀티모달 모델(LMM) 1. Transformer1.1. Transformer의 기초 개념 및 발전 Transformer는 언어 모델을 강력하게 만드는 기반임. RNN의 문제점을 해결하고 최신 LLM(대규모 언어 모델)의 선호 아키텍처가 됨.원래 Transformer 네트워크는 번역 작업을 위한 인코더-디코더 구조로 소개 됨.2018년, 인코더 전용 모델인 BERT의 도입으로 아키텍처의 진화가 시작됨.이후, GPT 모델의 첫 번째 버전에서는 디코더 전용 네트워크가 도입됨.인코더-디코더 구조는 번역과 같은 쌍방향 작업에 적합함.인코더 전용 모델은 문장 내의 관계와 문맥을 깊이 이해하는 데 강점이 있음.디코더 전용 모델은 텍스트 생성과 같은 일방향 작업에 적합함. 1.2. 인코더-디코더 구조 차이 및 활용 인코더 전용과 디코더 .. 2025. 11. 30.
[AI Privacy] LLM의 등장과 고려점, LLM의 핵심 요소 1. LLM의 등장과 고려점1.1. NLP 모델의 발전 과정 지속적인 발명과 개선: NLP 모델은 초기 통계 모델에서 대규모 언어 모델(LLM)에 이르기까지 끊임없이 발전해왔음.Bag of Words (1954)문서 분류를 위해 단어 발생 횟수를 세는 간단한 모델.제한점: 단어 순서와 문맥을 고려하지 않음.TF-IDF (1972)희귀성을 고려하여 단어에 가중치를 부여해 문서의 관련성을 개선.제한점: 여전히 단어 문맥을 반영하지 않음.Word2Vec (2013)단어 임베딩을 통해 단어 간 미묘한 의미적 연결을 포착.의의: 텍스트의 의미적 연관성을 고차원 벡터로 표현하며 NLP에 큰 전환을 가져옴. 1.2. NLP 모델의 주요 발전 단계Recurrent Neural Networks (RNNs)시퀀스 학습에 .. 2025. 11. 21.
[AI] KoBERT로 다중 분류 모델 제작 1. BERT와 KoBERT1.1. BERT(Bidirectional Encoder Representations from Transformers)2018년 구글에서 발표한 사전 학습된 언어 모델 양방향 학습: 기존 모델이 단방향(앞에서 뒤로만)으로 문장을 읽는 것과 달리, BERT는 단어의 앞뒤 문맥을 모두 고려해 학습 Transformer 기반: BERT는 트랜스포머(Transformer)의 인코더만 사용한 구조로 여러 레이어의 인코더가 쌓여있는 형태 사전 학습 + 파인튜닝: 대량의 텍스트로 사전 학습한 후, 특정 작업에 맞게 파인튜닝(fine-tuning)하여 사용 임베딩: BERT는 토큰(Token), 세그먼트(Segment), 포지션(Position) 임베딩을 결합해 입력을 구성 성능: BE.. 2025. 11. 16.
[AI Privacy] ROC AUC, Dense, CNN, RNN, LSTM 1. ROC AUC 이진 분류기와 ROC AUC의 개념 이진 분류기 개념이진 분류기(Binary Classifier)는 두 개의 클래스 중 하나에 대한 확률 점수 y^​를 출력함.반대 클래스에 대한 확률은 1−y^로 계산됨.예: 긍정 리뷰일 확률이 0.85이면, 부정 리뷰일 확률은 1−0.85=0.15로 계산됨.단순 임계값(Single Threshold)의 한계일반적으로 y^>0.5일 때 하나의 클래스로 분류됨.그러나 단순 임계값은 신뢰도 차이를 반영하지 못함.예: y^​=0.51과 y^=0.48의 분류 결과는 차이가 크지 않음에도 각각 다른 클래스로 분류됨. ROC AUC의 장점과 평가 방식ROC AUC 개념정의: ROC AUC(Receiver Operating Characteristic Area U.. 2025. 11. 9.
[AI Privacy] Natural Language Processing(NLP), Creating Word Embeddings with word2vec 1. Natural Language Processing(NLP)자연어 처리와 순환 신경망 (RNN) 활용 단어 벡터 (Word Vectors)언어의 의미를 수치적으로 표현하여, 딥러닝 모델의 입력으로 사용 가능.NLP 모델의 레이어 구성Dense 레이어: 기존에 소개한 기본 레이어 활용.Conv 레이어: 이미지 처리를 넘어, NLP 모델에서도 적용 가능.RNN 레이어: 순차적 데이터(예: 텍스트, 금융 시계열)를 처리하는 다재다능한 구조.병렬 처리와 모델 정확도 향상다중 병렬 스트림을 활용하여 모델 아키텍처 설계의 창의성 확대 및 정확도 개선 가능. 자연어 데이터 전처리 기법토큰화 (Tokenization)문서를 개별 언어 요소(예: 단어)로 나눔.소문자 변환모든 문자를 소문자로 변환하여 대문자에 의한 .. 2025. 10. 31.
[AI Privacy Lab] LLM을 위한 텍스트 데이터 준비 (2) Working with Text Data- 텍스트 데이터를 LLM 학습용으로 준비하는 과정 5. BytePair encodingGPT-2는 Byte Pair Encoding(BPE) 토크나이저를 사용해 단어를 서브워드 단위로 분해현재는 Rust 기반의 tiktoken 라이브러리를 활용해 약 5배 빠른 속도로 처리할 수 있다. tiktoken 설치 및 버전 확인pip install tiktoken으로 설치 후, importlib.metadata.version("tiktoken")을 통해 버전 확인.현재 버전은 0.12.0 사용.GPT-2 인코더 불러오기tiktoken.get_encoding("gpt2")로 GPT-2에서 사용한 BPE 인코딩 방식을 불러옴.텍스트 인코딩문자열을 정의하고, tokenize.. 2025. 10. 31.
[AI Privacy] Convolutional Neural Networks(CNN), Applications of Machine Vision 1. Convolutional Neural Networks (CNN)컨볼루션 신경망(CNN)의 개요 컨볼루션 신경망(CNN):ConvNet 또는 CNN으로도 알려져 있음. 컨볼루션 레이어를 포함하는 인공 신경망으로, 하나 이상의 컨볼루션 레이어를 가짐. 특징공간 패턴을 효율적으로 처리할 수 있어, 컴퓨터 비전 분야에서 특히 효과적임.컨볼루션 레이어 덕분에 딥러닝 모델이 이미지 및 비디오 데이터를 효율적으로 학습할 수 있음. 이미지 데이터의 차원 축소와 시각적 정보 손실 1차원 변환의 문제:MNIST 손글씨 데이터 예시에서, $28\times28$ 픽셀 이미지 데이터를 1차원 배열(784 요소)로 변환함.완전 연결 신경망(Dense Network)에서 필요한 단계였지만, 이 과정에서 중요한 시각적 구조 .. 2025. 10. 26.
[AI Privacy Lab] LLM을 위한 텍스트 데이터 준비 (1) Working with Text Data - 텍스트 데이터를 LLM 학습용으로 준비하는 과정 PyTorch(torch)와 tiktoken 버전을 확인한다. 1. Understanding word embeddings 임베딩(Embedding)은 텍스트·오디오·비디오 데이터를 벡터 공간으로 변환하는 과정LLM은 보통 수천 차원의 고차원 공간에서 임베딩을 다루지만, 시각화를 위해 2차원 예시를 사용Text Embedding Model은 텍스트를 입력받아 고정 길이 벡터로 변환변환된 벡터는 단어 간 의미적 유사성을 수학적으로 계산 가능하게 함예시 그림에서는 “독일-베를린, 영국-런던” 관계처럼, 단어의 의미적 관계가 공간상에서 벡터 거리로 표현 2. Tokenizing text 토큰화(Tokenization).. 2025. 10. 17.
[AI Privacy] Deep NN 학습 과정, Gradient decent, Backpropagation, NN 개선 1. Cost FunctionForward Propagation: 입력값이 신경망을 통해 전달되면서 출력값인 ŷ 을 생성함이상적 출력값: 네트워크가 완벽하게 조정되었다면, ŷ= y 가 되어야 함 예: 핫도그 분류기에서 y=1 일 때, ŷ= 1 현실적 출력값: 실제로는 ŷ= y가 항상 성취되지 않음y = 1인 상황에서 ŷ = 0.9997이면 매우 높은 신뢰도를 의미함 ŷ = 0.9 는 수용 가능, ŷ = 0.6 는 실망스러움, ŷ = 0.1192 는 매우 낮은 성능임손실 함수 (Loss Functions):출력 평가를 위한 비용 함수를 사용하여 정확도를 평가대표적인 두 가지 손실 함수:Quadratic CostCross-Entropy Cost 2. Quadratic Cost 오차 계산: 주어진 인스턴스 i.. 2025. 10. 17.
[AI Privacy Lab] 기초 Dot Product 연산, Vectorization(벡터화), Matrix Multiplication, Softmax 함수 Dot Product(점곱) 연산 두 벡터의 대응되는 원소끼리 곱한 뒤 모두 더해 하나의 스칼라 값을 얻는 연산a⋅b=a1​b1​+a2​b2​+⋯+an​bn​ 두 벡터가 얼마나 같은 방향을 보고 있는지를 수치화해서 유사도를 측정하는 지표로 활용두 벡터가 방향이 완전히 같으면 dot product 값이 크고 양수 → 유사도가 높음두 벡터가 직각(90°)이면 dot product = 0 → 관련성 없음두 벡터가 반대 방향이면 dot product 값이 음수 → 유사도가 낮음 리스트 정의: a = [1, 2, 3], b = [4, 5, 6]zip 활용: 각 원소를 묶어 곱하고 합산 → 결과 32인덱스 활용: 같은 위치 원소를 곱하고 합산 → 결과 32공통점: 두 방식 모두 동일한 dot product 계산\.. 2025. 10. 12.
Titanic 타이타닉 데이터 분석 보호되어 있는 글 입니다. 2025. 10. 9.