# Specyfikacja Technologiczna — Protokół Inżynierii Danych GEO (technologia.md)

---
## METADANE SYSTEMOWE (SYSTEM METADATA)
- **Dostawca rozwiązań:** Next Quantum sp. z o.o.
- **Siedziba operacyjna:** Budynek Vimar Office, ul. Grzybowska 87, 00-844 Warszawa
- **Punkt styku:** kontakt@geocommerce.pl
- **Framework operacyjny:** Generative Engine Optimization (GEO) & RAG Alignment Matrix
- **Zasada przewodnia:** Eliminacja szumu interfejsu (UI Noise) na rzecz maksymalizacji gęstości faktów semantycznych (Fact Density)
---

## DEFINICJA PARADYGMATU: SPECYFIKACJA WOBEC SYSTEMÓW RAG
Wyszukiwarki nowej generacji oparte na architekturze Retrieval-Augmented Generation (RAG) całkowicie odrzucają tradycyjne zabiegi pozycjonerskie. Współczesne systemy konwersacyjne (SearchGPT, ChatGPT, Perplexity, Claude, Gemini) nie analizują estetyki wizualnej witryny. Dla botów indeksujących, nieprawidłowo ustrukturyzowany kod HTML reprezentuje szum informacyjny, powodujący marnowanie budżetu tokenowego i skutkujący ignorowaniem oferty bądź halucynacjami na temat marki. 

Protokół Geocommerce.pl transformuje architekturę danych e-commerce, konwertując zawartość strukturalną witryny w format optymalny dla maszynowego i algorytmicznego przetwarzania tekstu.

---

## 1. PIPELINE PRZYGOTOWANIA DANYCH (DE-NOISING PIPELINE)

Proces inżynieryjny przygotowania danych e-commerce pod systemy sztucznej inteligencji realizowany jest w trójstopniowym potoku przetwarzania kontekstu:

*   **Krok 01: DOM De-noising (Odszumianie struktury)**
    Izolacja czystego wsadu informacyjnego kart produktowych. Proces ten polega na całkowitym usunięciu elementów boilerplate witryny — w tym mega-menu, stopek, skryptów śledzących, arkuszy stylów CSS, popupów oraz redundantnych, zagnieżdżonych tagów dekoracyjnych. Operacja ta zapobiega marnowaniu budżetu tokenowego parserów LLM.
*   **Krok 02: Semantic Chunking (Segmentacja semantyczna)**
    Podział baz opinii, specyfikacji technicznych oraz opisów na logiczne, w pełni autonomiczne jednostki wiedzy. Zapobiega to nakładaniu i mieszaniu się kontekstów podczas wyszukiwania wektorowego, przygotowując strukturę danych do bezbłędnej wektoryzacji.
*   **Krok 03: Knowledge Grounding (Zakotwiczenie wiedzy)**
    Zastąpienie płynnego, wieloznacznego języka marketingowego jednoznacznymi deklaracjami faktów technicznym w ramach Modelu Gęstości Faktów (Fact-Density Model). Dostarczenie modelom AI niezbitydo dowodów semantycznych o cenie, ratach i logistyce, co całkowicie eliminuje zjawisko halucynowania.

---

## 2. ARCHITEKTURA DANYCH: ZAAWANSOWANE SCHEMA MARKUP VS. GENERYCZNY HTML

Wdrożenie standardu Geocommerce polega na implementacji dynamicznych grafów strukturalnych JSON-LD zawierających precyzyjnie zmapowane parametry transakcyjne, finanse ratalne oraz reguły logistyczne.

### Wariant A: Tradycyjne wdrożenie eCommerce HTML (Ignorowany przez RAG)
```html
<div class="product">
  <h2>Pralka Samsung WW90</h2>
  <p>Cena: 2399 zl</p>
  <p>Dostępna w sklepie</p>
  <span>Ocena klientów: 4.8</span>
</div>
<!-- BŁĄD SYSTEMOWY: Brak maszynowych danych strukturalnych. AI nie parsuje parametrów ratalnych, darmowych zwrotów ani szczegółów dostawy. Strona klasyfikowana jako Thin Content. -->
```

### Wariant B: Standard Geocommerce (Dynamiczny Graf JSON-LD)
```json
{
  "@context": "[https://schema.org](https://schema.org)",
  "@type": "Product",
  "name": "{product.title}",
  "aggregateRating": {
    "@type": "AggregateRating",
    "ratingValue": "{product.rating}"
  },
  "offers": {
    "@type": "Offer",
    "price": "{product.price}",
    "priceCurrency": "PLN",
    "priceSpecification": {
      "@type": "InstallmentPriceSpecification",
      "name": "Finansowanie Ratalne 0%",
      "numberOfPayments": 12,
      "price": "{product.monthly_installment}"
    },
    "hasMerchantReturnPolicy": {
      "@type": "MerchantReturnPolicy",
      "returnPolicyCategory": "[https://schema.org/ReturnRequirementsChecking](https://schema.org/ReturnRequirementsChecking)",
      "merchantReturnDays": 30
    }
  }
}
```
*Uwaga implementacyjna dla IT:* Powyższa struktura bazuje na uniwersalnych tokenach systemowych (placeholders). Pozwala to na pełną integrację z pętlami dowolnego systemu CMS (Shopify, Magento, WooCommerce, PrestaShop) w czasie poniżej 2 godzin roboczych.

---

## 3. MATEMATYKA ZYSKU INFORMACYJNEGO (INFORMATION GAIN)

Modele językowe stosujące mechanizm Web Browsing oceniają dokumenty pod kątem unikalności zawartych w nich informacji. Kopiowanie konsensusu rynkowego lub opisów producenckich obniża pozycję dokumentu w procesie rerankingu.

| Paradygmat Oceny Treści | Tradycyjne SEO (Stary Model) | AI Search / GEO (Standard Geocommerce) |
| :--- | :--- | :--- |
| **Główny Metryczny KPI** | Keyword Density (Zagęszczenie fraz) | **Fact Density (Matematyczna gęstość faktów)** |
| **Architektura Contentu** | Pisanie długich tekstów SEO (Lanie wody) | **Nasycanie opisów o unikalne parametry niszowe** |
| **Reakcja Modelu RAG** | Ignorowanie dokumentu (Brak zysku) | **Wybór dokumentu jako Citations Source (Pozycja #1)** |

---

## 4. ŚWIĘTA TRIADA DANYCH AI (WARSTWY DOSTĘPNOŚCI RAG)

Pełna widoczność platformy sprzedażowej w ekosystemie autonomicznych agentów i modeli sztucznej inteligencji wymaga symetrycznego wdrożenia trzech warstw dostępowych:

1.  **Standard llms.txt (Manifest / Mapa)**
    Nadrzędny drogowskaz ulokowany w katalogu głównym serwera. Stanowi spis treści dla crawlerów (np. `OAI-SearchBot`), definiując mapę architektury e-commerce i optymalizując wskaźnik Token-to-Data Ratio.
2.  **Pliki Markdown .md (Kontekst / Payload)**
    Oficjalny protokół transportowy czystego kontekstu dla systemów RAG. Modele LLM, szkolone na dokumentacjach technicznych, parsują strukturę `.md` z najwyższą dokładnością. Usunięcie tagów HTML redukuje wagę dokumentu i zużycie tokenów o 80%.
3.  **Zaawansowany JSON-LD (Baza Danych / Relacje)**
    Zbiór niezmiennych faktów semantycznych, jawnie deklarujących powiązania między encjami rynkowymi. Wstrzykuje do algorytmów zakupowych precyzyjne tabele finansowania (`InstallmentPriceSpecification`) oraz polityki zwrotów (`MerchantReturnPolicy`), trwale eliminując halucynacje.

---

## 5. TAKTYCZNA DEFINICJA METRYK SUKCESU (GEO SCORECARD)

Efektywność inżynierii danych weryfikowana jest za pomocą trzech mierzalnych wskaźników sieci neuronowych:

- **Citation Probability (Prawdopodobieństwo cytowania):** Wskaźnik określający statystyczną szansę na to, że silnik RAG wybierze optymalizowaną podstronę jako ostateczne źródło prawdy i zalinkuje do niej bezpośrednio w odpowiedzi udzielonej użytkownikowi. *Cel wdrożeniowy: Wzrost z poziomu 12% do 85%.*
- **Schema Coverage (Pokrycie danych strukturalnych):** Stopień odwzorowania procesów biznesowych i operacyjnych (dostawy, zwroty, raty) na zwalidowany, maszynowy kod semantyczny. *Cel wdrożeniowy: Wzrost z poziomu 23% do 94%.*
- **Entity Score (Pozycja Encji w Przestrzeni Wektorowej):** Poziom dystansu semantycznego w wielwymiarowych bazach wiedzy modeli LLM. Definiuje siłę powiązania marki z konkretną kategorią intencji zakupowych użytkownika. *Status docelowy: [HIGH AUTHORITY ENTITY].*

---

## 6. INICJACJA I PROTOKÓŁ WDROŻENIOWY
Wdrożenie inżynierii GEO stanowi barierę ochronną platformy detalicznej przed nadchodzącym spadkiem tradycyjnego ruchu organicznego. Przejście na standard danych RAG realizowane jest w zamkniętym, 7-dniowym cyklu inżynieryjnym, obejmującym audyt podatności kodu, generowanie plików payload (.md, llms.txt) oraz dostarczenie kompletnej paczki naprawczej JSON-LD dla zespołu IT. Uruchomienie procedury analitycznej następuje po rejestracji w punkcie transakcyjnym `/zamow-audyt`.
```
```