9042110ea2
Cinco issues que componen el plan: - 0026: sistema de jobs (infra, contrato wire) - 0027: tipo Webpage + cache de documentos - 0028: enricher fetch_webpage (MVP end-to-end) - 0028b: enrichers extract_domain / extract_links / extract_text_entities - 0029: variantes CDP (Chrome headless, screenshot) - 0030: macro "Deep enrich" + expand_domain Tambien anade los issues previos 0012-0025 que estaban untracked. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>
2.3 KiB
2.3 KiB
id, title, status, priority, created, depends_on
| id | title | status | priority | created | depends_on | |
|---|---|---|---|---|---|---|
| 0028b | Enrichers extract_domain, extract_links, extract_text_entities | pending | high | 2026-05-01 |
|
Objetivo
Tres enrichers Python adicionales que reusan el contrato validado por
fetch_webpage. Cada uno cubre un eje de extraccion distinto.
1. extract_domain
applies_to: [Url, Webpage, Email]
emits: [Domain]
relations: [BELONGS_TO]
- Saca el dominio de
metadata.urlometadata.address. - Crea nodo
Domainsi no existe + relacionBELONGS_TO. - Util cuando el usuario tiene un Url/Email que aun no ha sido fetched pero quiere ver el dominio en el grafo.
2. extract_links
applies_to: [Webpage]
emits: [Url]
relations: [LINKS_TO]
- Lee
metadata.markdown_path. Si vacio → exit con error "run fetch_webpage first". extract_urls_py_cybersecuritysobre el contenido.- Para cada URL distinta encontrada:
- Crea nodo
Urlconmetadata.url(si no existe). - Relacion
LINKS_TOdesde la Webpage origen.
- Crea nodo
- Param:
max_links(default 50) para no saturar el grafo.
3. extract_text_entities
applies_to: [Webpage]
emits: [Person, Org, Email, Phone, Domain, Location, IPAddress, CVE, ...]
relations: [EXTRACTED_FROM, ...relaciones que GLiREL detecte]
- Lee
metadata.markdown_path. - Llama
extract_graph_hybrid_py_pipelines(regex IoCs + GLiNER + GLiREL + LLM fallback). - Para cada entidad detectada:
- Resuelve por
(name, type)en operations.db. Si no existe la crea. - Relacion
EXTRACTED_FROMdesde la entidad nueva al nodo Webpage.
- Resuelve por
- Para cada relacion detectada por GLiREL:
- Relacion entre las dos entidades con el
kindpredicho.
- Relacion entre las dos entidades con el
- Params:
chunk_size(default 2000)use_llm_fallback(default false — evitar coste; el usuario lo activa en jobs concretos)
Definicion de hecho
- Los tres enrichers aparecen en el menu "Run enricher" segun el tipo del nodo right-clickado.
- En un nodo Webpage el menu muestra los 3 + fetch_webpage.
- Test integracion:
- Crear Url → fetch_webpage → run extract_links sobre el resultado → run extract_text_entities → grafo se llena con persons/orgs/etc.
- Cada paso es un job independiente visible en panel Jobs.
extract_text_entitiescon LLM off termina sin coste y produce entidades de IoC + entidades GLiNER (gratis).