ᲫᲘᲠᲙᲕᲘᲡ ᲨᲔᲡᲐᲮᲔᲑ
როგორ მუშაობსᲨᲔᲙᲘᲗᲮᲕᲘᲡ ᲬᲐᲙᲘᲗᲮᲕᲐ
ლათინური ასოებით დაწერილს ძირკვა ქართულად კითხულობს: kartuli anbani იგივეა, რაც ქართული ანბანი. სიტყვას ასწორებს მხოლოდ მაშინ, თუ მსგავსი სიტყვა ქართულ ტექსტებში 20-ჯერ უფრო ხშირია და პირველი შედეგებიც ამას ადასტურებს. თუ დაწერილი სიტყვაც ნამდვილია, შედეგებს არ ცვლის და მხოლოდ გკითხავთ: „ხომ არ გულისხმობდით“.
ᲡᲘᲢᲧᲕᲘᲡ ᲧᲕᲔᲚᲐ ᲤᲝᲠᲛᲐ
ქართულ სიტყვას ბევრი ფორმა აქვს. ძირკვა 488 ათასი ფორმის ლექსიკონით და გრამატიკის წესებით პოულობს ყოველი სიტყვის ლექსიკონის ფორმას და ეძებს ორივეთი, როგორც დაწერეთ და ლექსიკონის ფორმით. ამიტომ ქუთაისში, ქუთაისის და ქუთაისი ერთ სიტყვად ითვლება, შედეგში კი ყველა ფორმა ყვითლად ინიშნება.
ᲠᲐ ᲒᲭᲘᲠᲓᲔᲑᲐᲗ
ძირკვას 53 საჭიროების სია აქვს: ამინდი, კანონი, სკოლა, კვლევა, წიგნები, რელიგია და სხვა. თითოეულს თავისი საიტები აქვს, და ძირკვა ამ საიტებზე ცალკეც ეძებს. თუ შეკითხვაში „დისერტაცია“ ან „სტატია“ წერია, ნაშრომები წინ დგას და ამ ტიპის ნაშრომები პირველია.
ᲡᲐᲓ ᲔᲫᲔᲑᲡ
ერთდროულად ეკითხება რამდენიმე საძიებო სისტემას და საკუთარ ინდექსებს: ქართულ ვიკიპედიას (173 ათასი სტატია), ვიკიწყაროს, ჩვენ მიერ შეგროვებულ 509 ათას გვერდს 977 საიტიდან, „ივერიელის“ 246 ათას ჩანაწერს, 29 ათას სამეცნიერო ნაშრომს და ძველი ვების ასლებს. საძიებო სისტემების პასუხები ერთი დღე ინახება, ამიტომ იგივე ძიება მეორედ ბევრად სწრაფად ჩნდება.
ᲐᲖᲠᲘᲗ ᲫᲘᲔᲑᲐ
ადგილობრივი ენის მოდელი (BGE-M3) 872 ათას აბზაცს ინახავს რიცხვების სახით: ვიკიპედიის, ვიკიწყაროს, ნაშრომებისა და ბიბლიოთეკის ტექსტებს. შეკითხვაც ასეთ რიცხვებად იქცევა, და ძირკვა პოულობს აბზაცს, რომელიც იგივეს სხვა სიტყვებით ამბობს. მოდელი ამ კომპიუტერზე მუშაობს და ფასიანი სერვისი არ სჭირდება.
ᲠᲘᲒᲘ
ყოველი შედეგი ქულას იღებს. ქულა იზრდება, თუ გვერდს რამდენიმე წყარო პოულობს, თუ აზრით ახლოსაა შეკითხვასთან, თუ შეკითხვის ყველა სიტყვა აქვს (იშვიათი სიტყვა მეტს ითვლის), თუ სანდო საიტზეა, თუ ვიკიპედია მას ციტირებს, ან თუ პირადი საიტი ან ბლოგია. ერთ საიტს მთავარ სიაში 2 ადგილი აქვს, ერთი და იგივე ტექსტი ბევრ საიტზე კი ერთ შედეგად ჩანს.
ᲛᲔᲝᲠᲔ ᲠᲐᲣᲜᲓᲘ
თუ პირველი ათი შედეგიდან 5-ზე ნაკლებს აქვს შეკითხვის ყველა სიტყვა, ძირკვა საუკეთესო შედეგებიდან იღებს იშვიათ სიტყვებს, რომლებსაც პასუხის გვერდები იყენებს, და მათით მეორედ ეძებს. ეს სიტყვები შედეგებში ცისფრად ინიშნება.
ᲞᲐᲡᲣᲮᲘᲡ ᲧᲣᲗᲔᲑᲘ
„X რას ნიშნავს“ ვიქსიკონის 8,231 სიტყვიდან განმარტებას და სინონიმებს აჩვენებს. თუ შეკითხვა ვიკიპედიის სტატიის სახელია, სიის თავზე სტატიის პირველი წინადადებები ჩანს. ნაშრომს ახლავს ავტორი, წელი, ჟურნალი, PDF და მზა ციტირება.
ᲧᲕᲔᲚᲐᲤᲔᲠᲘ ᲩᲐᲜᲡ
ყოველი შედეგის ქვეშ წერია, რომელმა წყარომ იპოვა და რომელ ადგილზე, რა სიტყვები დაემთხვა და რა ქულა მიიღო. „როგორ ვიპოვეთ“ ველში ჩანს ყველა შეკითხვა, რაც ძირკვამ გაგზავნა, და თითოეულის დრო.
ᲐᲓᲐᲛᲘᲐᲜᲘᲡ ᲢᲔᲥᲡᲢᲘᲡ ᲜᲘᲨᲜᲔᲑᲘ
- ᲞᲐᲢᲐᲠᲐ ᲕᲔᲑᲘ 1000 სიტყვაზე მინიმუმ 10 პირველი პირის სიტყვა („მე“, „ჩემი“, „ვფიქრობ“, „მახსოვს“ …), 5-ზე ნაკლები კომპანიის სიტყვა („შპს“, „მომსახურება“, „ფასი“ …) და 1-ზე ნაკლები სააგენტოს სიტყვა („განაცხადა“, „ცნობით“ …). არ არის სახელმწიფო, ახალი ამბების, ტელევიზიის, რადიოს, სპორტის, სკოლის ან სასამართლოს საიტი, მაღაზია არ აქვს და მასზე მაქსიმუმ 30 საიტი ან ვიკიპედიის სტატია მიუთითებს (ერთი ადამიანის ბლოგზე რამდენიც არ უნდა იყოს).
- ᲡᲐᲛᲔᲪᲜᲘᲔᲠᲝ ჟურნალის ან უნივერსიტეტის რეპოზიტორია (OAI-PMH), .edu ან .ac.ge საიტი, ან ეროვნული ბიბლიოთეკის „ივერიელი“. ინდექსში 29,436 ნაშრომია 29 ჟურნალიდან და რეპოზიტორიიდან.
- ᲕᲘᲙᲘᲞᲔᲓᲘᲘᲡ ᲬᲧᲐᲠᲝ გვერდს ციტირებს ვიკიპედიის სტატია, რომელიც შეკითხვას სიტყვებით ან აზრით ყველაზე ახლოს დგას.
- ᲫᲕᲔᲚᲘ ᲕᲔᲑᲘ ვიკიპედიაში ციტირებული, ახლა დახურული ქართული საიტების ასლები ინტერნეტ-არქივიდან.
- ᲡᲐᲜᲓᲝ ᲬᲧᲐᲠᲝ 97 საიტი ხელით შედგენილი სიიდან: ოფიციალური, სამეცნიერო და საცნობარო საიტები, ჟურნალისტიკა და ინსტიტუტები.
- ᲐᲓᲠᲔ ᲐᲠᲩᲔᲣᲚᲘ დაწკაპება ითვლება, თუ იმავე კითხვაზე 30 წამში სხვა დაწკაპება არ მოჰყვა.
ყოველი ნიშანი ქულას ზრდის; ქულა და მიზეზი ჩანს ყოველი შედეგის ქვეშ.
ᲠᲐᲡ ᲐᲨᲝᲠᲔᲑᲡ
- თუ ორ ამონარიდს სიტყვების 60% საერთო აქვს, ეს ერთი ტექსტია და ერთ შედეგად ჩანს.
- ერთი საიტი მთავარ სიაში მაქსიმუმ 2-ჯერ ჩანს.
- თუ სათაურსა და ამონარიდში ქართული ასოები 30%-ზე ნაკლებია, შედეგი არ ჩანს (გარდა საიტებისა, რომლებიც ძირითადად ქართულად წერენ).
- ქრაულერი ახალ საიტს მთლიანად მხოლოდ მაშინ აგროვებს, თუ მისი გვერდები ქართულია და ის მაღაზია არ არის.
ᲠᲝᲒᲝᲠ ᲨᲔᲘᲫᲚᲔᲑᲐ ᲒᲐᲘᲖᲐᲠᲓᲝᲡ
- სრული ქრაული. ახლა ქრაულერი ერთი საიტიდან რამდენიმე ათას გვერდს აგროვებს. თუ ყველა ქართულ საიტს ბოლომდე წაიკითხავს, ძიებას გარე საძიებო სისტემები ნაკლებად დასჭირდება.
- ახალი გვერდები ყოველდღე: საიტების RSS არხები და საიტის რუკები (sitemap) ყოველ დილით, რომ ახალი სტატია იმავე დღეს იძებნებოდეს.
- ბიბლიოთეკისა და ჟურნალების სრული ტექსტი: ივერიელის და ქართული ჟურნალების PDF ფაილები, სკანირებული წიგნებისთვის კი ტექსტის ამოცნობა (OCR).
- აზრით ძიება მთელ ინდექსზე: ყოველი გვერდის ვექტორი წინასწარ დაითვლება, ამიტომ ძიებას ვიდეობარათი აღარ დასჭირდება და იაფ სერვერზეც იმუშავებს.
- საიტის დამატება: ბლოგის ან საიტის ავტორი თავად შეძლებს მის შეთავაზებას.
- ღია მონაცემები: საიტების სია, ნაშრომების კატალოგი და საიტებს შორის ბმულების რუკა სხვა პროექტებისთვისაც.
ᲬᲧᲐᲠᲝᲔᲑᲘ
- საძიებო სისტემები: იანდექსი, იაჰუ, გუგლი და ბრეივი. მათ შედეგებს ვინახავთ ერთი დღით (ბრეივისას ერთი კვირით).
- ვიკიპედია, ვიკიწყარო და ვიქსიკონი: ტექსტები CC BY-SA 4.0 ლიცენზიით; ყოველ ამონარიდს ახლავს ბმული სტატიაზე.
- ივერიელი: ეროვნული ბიბლიოთეკის ციფრული ბიბლიოთეკის კატალოგი.
- სამეცნიერო ჟურნალები და უნივერსიტეტების რეპოზიტორიები: ნაშრომების აღწერები მათი OAI-PMH არხებიდან; ბმულები ორიგინალზე მიდის.
- ჩვენი ქრაულერი: სანდო ქართული საიტები და პატარა ვები. იცავს robots.txt-ს და ერთ საიტს წამში ერთხელ მიმართავს.
- ძველი ვები: დახურული საიტების ასლები ინტერნეტ-არქივიდან (Wayback Machine).
ᲠᲐᲡ ᲕᲘᲜᲐᲮᲐᲕᲗ
- ყოველ ძიებას, ჩანართს, ფილტრს და დაწკაპებას: სიტყვებს, დროს, შედეგის ადგილს, მოწყობილობის ტიპს (ტელეფონი ან კომპიუტერი) და ბრაუზერის ენას.
- IP მისამართს არ ვინახავთ.
- ერთი ვიზიტის ნაბიჯებს აკავშირებს შემთხვევითი ნომერი (ქუქი), რომელიც ბოლო მოქმედებიდან 30 წუთში ქრება. თუ ბრაუზერი აგზავნის Do Not Track ან GPC სიგნალს, ნომერს არ ვქმნით.
- ჩანაწერები 180 დღეში იშლება.
- რატომ: ვხედავთ, რას ვერ პოულობს ძირკვა და სად უნდა გაუმჯობესდეს.