Embeddings: MPNet Base (768d)


Embeddings: MPNet Base (768 dimensões)

Representação semântica de alta qualidade usando MPNet multilingual.

🤖 Modelo

Sentence Transformers: paraphrase-multilingual-mpnet-base-v2

Características

  • Arquitetura: MPNet Base (Microsoft)
  • Treinamento: 50+ idiomas incluindo português
  • Dimensões: 768 (modelo base - máxima qualidade)
  • Tamanho: ~1.1 GB
  • Otimização: Similaridade semântica e paraphrase detection
  • Performance: Estado da arte em tarefas multilingual

Por Que Este Modelo?

✅ Máxima qualidade - 768 dimensões para representação completa
✅ Multilingual nativo - Excelente em português
✅ Estado da arte - Entre os melhores modelos disponíveis
✅ Para análise profunda - Prioriza qualidade sobre velocidade

Script: scripts/generate_embeddings_mpnet.py


📋 Features Criadas

Feature Tipo Definição Valores Uso
embedding array[768] Vetor semântico da mensagem (768 dimensões) Array de floats (-1.0 a 1.0), normalizado Base para clustering, busca semântica, topic modeling
similaridade_anterior float Similaridade cosine com mensagem anterior 0.0 (diferente) a 1.0 (idêntico) Detectar continuidade/mudança de assunto
densidade_local float Distância média aos 10 vizinhos mais próximos 0.0 (densa) a 1.0 (esparsa) Identificar mensagens únicas/anômalas

Embeddings são salvos em arquivo separado para otimização: - Embeddings: message_embeddings_mpnet.npy (~201 MB) - Features derivadas: No parquet principal (leves)

# Carregar no EDA:
embeddings = np.load('data/processed/message_embeddings_mpnet.npy')

💻 Execução

python scripts/generate_embeddings_mpnet.py

📊 Resultados

### 📊 Estatísticas Gerais
Métrica Valor
Mensagens processadas 68,686
Dimensões 768
Tamanho do arquivo 201.23 MB
Device cpu
Tempo total 7.09 min
Velocidade 227.2 msgs/s

### 📈 Estatísticas dos Vetores
Métrica Valor
Shape (68686, 768)
Média 0.0012
Desvio Padrão 0.0361
Mínimo -0.3004
Máximo 0.3973

### 📊 Distribuição de Normas

**Média da norma:** 1.0000
**Embeddings normalizados têm norma ≈ 1.0**
### 🔍 Análise de Similaridade

**Calculando similaridades** (amostra de 1,000 mensagens)...

**Estatísticas de Similaridade:**
Métrica Valor
Média 0.363
Mediana 0.351
Desvio Padrão 0.150
Mínimo -0.132
Máximo 1.000

### Distribuição de Similaridades

**Interpretação:**
- **Alta (> 0.7):** Mensagens muito parecidas
- **Média (0.4-0.7):** Mensagens relacionadas
- **Baixa (< 0.4):** Mensagens sobre assuntos diferentes
### 💬 Busca Semântica

Exemplos de mensagens semanticamente similares:


**Mensagem:** "OBRIGADA MEU AMOR!!!!..."

**Top 3 similares:**
# Mensagem Similaridade
1 Gostosoooo!!!... 0.799
2 curti o som!!... 0.743
3 Amo!... 0.740

**Mensagem:** "Vc acha q devo falar com o Leonardo?..."

**Top 3 similares:**
# Mensagem Similaridade
1 Tudo bem, to em ligação com o Leo, coordenador... 0.578
2 É mas é melhor ele n ter ligação com nd meu mesmo... 0.553
3 O Léo vai te buscar no fim?... 0.549
### 📊 Features Derivadas

#### Similaridade com Mensagem Anterior
Métrica Valor
Média 0.544
Mediana 0.452
Desvio Padrão 0.292
Mínimo -0.114
Máximo 1.000

**Interpretação:**
- Similaridade média: 0.544
- Indica continuidade conversacional
- Valores baixos = mudança de assunto

#### Densidade Local
Métrica Valor
Média 0.132
Mediana 0.125
Desvio Padrão 0.103

**Interpretação:**
- Densidade média: 0.132
- Valores altos = mensagens únicas/raras
- Valores baixos = mensagens comuns/frequentes
### 📋 Detalhes do Processamento
Métrica Valor
Modelo paraphrase-multilingual-mpnet-base-v2
Executado em 01/12/2025 17:15:56
Device cpu
Batch size 100
Tempo total 7.09 min
Velocidade 227.2 msgs/s

💡 Interpretação

Tip🎯 Características do MPNet Base

Perfil: Máxima Qualidade 🏆

Pontos Fortes: - ✅ 768 dimensões - Capacidade máxima de representação - ✅ Alta separação semântica - Distingue bem significados diferentes - ✅ Melhor para clustering - Grupos mais coesos e separados - ✅ Estado da arte - Entre os melhores modelos multilingual

Trade-offs: - ⚠️ Mais lento - ~227 msg/s (vs ~842 do MiniLM) - ⚠️ Maior tamanho - 201 MB (vs ~101 MB do MiniLM) - ⚠️ Mais memória - 768 dims requer mais RAM

Quando Usar: - Análise exploratória profunda - Clustering de alta qualidade - Topic modeling (BERTopic) - Quando qualidade > velocidade

Performance Observada: - Similaridade com anterior: ~0.54 (boa continuidade) - Densidade local: ~0.13 (boa distribuição) - Tempo de geração: ~7 minutos (68k mensagens, CPU) - Silhouette Score: 0.059 (melhor entre os 3 modelos)


Próximo: Comparação com outros modelos